
Voxtral Mini 4B Realtime Arabic vs MAI-Transcribe-2-Streaming: Duas Chegadas de Outubro, Dois Problemas de Evidência
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Sete dias separam esses dois modelos de fala em tempo real, e eles chegaram de maneiras opostas. MAI-Transcribe-2-Streaming é o primeiro modelo de transcrição em streaming da Microsoft AI, anunciado em 1º de outubro de 2026 com um post de lançamento, uma listagem de prévia no Azure, um preço introdutório de US$ 0,54 por hora de áudio até o fim do ano e a afirmação de ser o primeiro no ranking de streaming da Artificial Analysis tanto em precisão de transcrição final quanto parcial, com taxa de erro de palavra de 2,5% e o texto final pronto 0,13 segundos após o fim da fala. Voxtral Mini 4B Realtime Arabic é o modelo de streaming para dialetos árabes da Mistral AI, publicado no Hugging Face em 8 de outubro de 2026 sem nenhum anúncio — nenhum post de blog, nenhum preço, nenhum serviço, apenas pesos Apache 2.0 e um cartão de modelo que reporta 8,82% de taxa média de erro de caractere em sete benchmarks de árabe com um atraso de 480 milissegundos. O modelo da Microsoft é um produto acabado com uma manchete não verificável. O modelo da Mistral é um artefato verificável sem nenhum produto em volta dele. Vale a pena entender ambos justamente porque ambos deixam a questão central — quão bem isso lida com árabe — respondida apenas pelo fornecedor.
A comparação vale a pena de qualquer forma, porque os dois modelos enquadram a mesma decisão de engenharia a partir de extremos opostos. A Microsoft está vendendo amplitude e um serviço gerenciado: 60 idiomas com detecção automática e contínua de idioma, executados dentro do Azure AI Speech, com preço por hora, em versão prévia. A Mistral está entregando profundidade de graça: dezesseis variedades nomeadas de árabe, pequenas o suficiente para rodar em um único acelerador, com um script de normalização para que você possa auditar a pontuação por conta própria. Se você está implantando um pipeline de transcrição de árabe este mês, está escolhendo entre essas duas posições, e a escolha depende de evidências que você ainda não tem em nenhum dos dois casos.
O que cada fornecedor realmente disse, e o que dizem os conselhos
A lacuna de evidências é a característica mais importante deste confronto, por isso vem primeiro.
• MAI-Transcribe-2-Streaming — taxa de erro de palavras de 2,5% no transcrito final a 0,13 segundos após o fim da fala, e os mesmos 2,5% nas primeiras parciais a 0,12 segundos, ambos apresentados como primeiro lugar em precisão na metodologia AA-WER Streaming da Artificial Analysis. Enquadramento da própria Microsoft. No momento da redação deste texto, o painel de streaming do rastreador ainda não tinha plotado uma linha para o modelo, pelo que a alegação se apoia na metodologia do rastreador sem um número publicado pelo rastreador por trás dela.
• Voxtral Mini 4B Realtime Arabic — 8,82% de Taxa Média de Erro de Caractere em sete benchmarks de árabe com um atraso configurado de 480 milissegundos. A própria ficha técnica da Mistral, com o código de avaliação fornecido. Nenhum terceiro o reproduziu, e o modelo tem dois dias.
Portanto, os dois números em destaque neste artigo são, respetivamente, uma alegação de fornecedor medida pela régua de outra pessoa e uma alegação de fornecedor com a sua própria régua acoplada. Nenhum deles é uma medição independente. O que difere é que o número da Mistral chega acompanhado do script de normalização necessário para o recalcular, enquanto o da Microsoft chega com um conselho que ainda não o colocou no gráfico. Se está a tomar uma decisão de aquisição, essa distinção importa mais do que a diferença entre 2,5 e 8,82, que de qualquer forma não significa nada — a taxa de erro de palavras e a taxa de erro de caracteres não são conversíveis, e a ortografia árabe alarga consideravelmente a disparidade entre ambas.
A única comparação dentro da ficha da Mistral que realmente se sustenta é aquela contra seu próprio equivalente offline da mesma família: Voxtral Transcribe Arabic com 7,91% de CER nos mesmos sete benchmarks e com a mesma normalização, portanto o streaming custa a este modelo 0,91 ponto percentual. A Microsoft publicou um número equivalente para sua própria família quando lançou o MAI-Transcribe-2 em lote, em 3 de setembro de 2026, com 2,0% de taxa de erro de palavras — a variante de streaming cede meio ponto em relação ao modelo em lote ao mesmo tempo que adiciona entrega em tempo real. Leia esses dois deltas internos dos fornecedores lado a lado e você terá a única afirmação verdadeiramente comparável neste artigo: em seus próprios benchmarks, o SKU de streaming de cada laboratório fica atrás de seu equivalente em lote, por cerca de um ponto em um caso e meio ponto no outro, e ambos estão medindo idiomas diferentes.

Cobertura de idiomas: 60 contra 16, e a mesma lacuna sem nome em ambos os lados
• MAI-Transcribe-2-Streaming — 60 idiomas com detecção automática e contínua do idioma, de modo que uma sessão que muda de idioma durante a transmissão não precise que o idioma seja declarado de antemão. O material de lançamento da Microsoft fornece a contagem, e não a lista; a documentação de suporte a idiomas do Azure para a família MAI-Transcribe é onde a cobertura é detalhada item a item, e documenta o árabe entre os idiomas suportados pela família.
• Voxtral Mini 4B Realtime Arabic — dezesseis variedades de árabe, nomeadas individualmente: Árabe Padrão Moderno, Marroquino, Líbio, Tunisiano, Argelino e Árabe Hassaniya, Árabe do Golfo, Najdi, Omaniano e Sanaani, Árabe Egípcio e Sudanês, Árabe Mesopotâmico e tanto o Levantino do Sul quanto o do Norte, e Árabe Chadiano. Fora desse conjunto, o modelo é documentado como fora do escopo, com uma referência ao Voxtral Mini 4B Realtime geral.
Nenhum dos números diz o que você precisa. O 60 da Microsoft é uma contagem de abrangência que inclui o árabe sem descrever o desempenho em árabe; o post de lançamento informa o total de idiomas uma vez e segue adiante. O 16 da Mistral é uma enumeração de alvos de treinamento com uma única taxa de erro agregada em sete conjuntos de benchmarks, o que significa que o detalhamento por dialeto — aquilo que de fato determina se o áudio das suas chamadas marroquinas é transcrito — também não é publicado. Dois modelos, dois fornecedores, e em ambos os casos a resposta honesta para "quão bom ele é especificamente no árabe do Golfo" é: não declarado.
O que a enumeração lhe dá é um prior. Um modelo com árabe chadiano e árabe hassaniya como alvos nomeados foi ajustado a uma distribuição norte-africana; a Mistral co-desenvolveu-o com o Ministère de la Transition Numérique et de la Réforme Administrative de Marrocos e criou dois dos sete benchmarks com esse ministério — ISMA e Darija in the Wild — especificamente para medir os casos difíceis. Um modelo geral de 60 idiomas apresenta melhorias primeiro no árabe padrão moderno, porque é aí que está o volume de sinal de treino. Se o seu áudio for em Darija ou árabe do Golfo, esses são problemas diferentes, e apenas um destes dois fornecedores apresentou um número para qualquer um deles.
Latência e a forma do atraso
• MAI-Transcribe-2-Streaming — 0,13 segundos desde o fim da fala até a transcrição final, e os primeiros resultados parciais em 0,12 segundos, o que é rápido o suficiente para que a transcrição parcial e a final tenham efetivamente a mesma latência. Alegação da Microsoft, medida segundo a metodologia do tracker.
• Voxtral Mini 4B Realtime Arabic — 480 milissegundos de atraso configurado no ponto de precisão publicado, com o atraso ajustável. Isso é aproximadamente três vezes e meia o valor da Microsoft, e é o parâmetro que o operador escolhe, em vez de uma propriedade fixa.
Três décimos de segundo é uma diferença real para um agente de voz que precisa responder no meio do enunciado e quase invisível para um humano que lê legendas. É também a diferença entre um botão e um número. O parâmetro de atraso da Mistral significa que você pode operar de forma mais restrita e aceitar mais erros ou de forma mais folgada e recuperar a precisão — o modelo base do qual este checkpoint foi ajustado finamente anuncia uma faixa de 240 milissegundos até 2,4 segundos — enquanto o ponto de operação da Microsoft é o que a Azure disponibiliza. Isso torna o número da Microsoft mais fácil de raciocinar e o da Mistral mais fácil de ajustar, e significa que qualquer comparação dos dois números de precisão é, na verdade, uma comparação de dois pontos escolhidos em uma curva e um ponto fixo em outra.
A superfície de funcionalidades difere de forma igualmente acentuada, e vale a pena verificá-la em relação aos requisitos do seu pipeline antes que a discussão sobre precisão fique interessante.
• MAI-Transcribe-2-Streaming — fornecido por meio do Azure AI Speech com o conjunto de recursos documentado da família: diarização, carimbos de data/hora no nível da palavra, viés de palavras-chave e frases, estilos de saída literal versus limpo e identificação automática de idioma. A documentação do próprio SKU de streaming para diarização e carimbos de data/hora é mais enxuta do que a do modelo em lote, portanto confirme esses pontos por ponto de extremidade em vez de presumir paridade.

• Voxtral Mini 4B Realtime Arabic — o cartão documenta transcrição com um codificador de áudio causal, serviço vLLM através de um WebSocket em /v1/realtime, suporte nativo do Transformers a partir da versão 5.2.0 e um módulo de normalização. Não documenta diarização nem timestamps ao nível da palavra para este checkpoint.
Modelo de entrega: um serviço de pré-visualização versus pesos para download
• MAI-Transcribe-2-Streaming — prévia do Azure, o que significa que não há SLA e que há uma recomendação do fornecedor contra a dependência em produção. Com preço de US$ 0,54 por hora de áudio como tarifa introdutória válida até o final de 2026, sem que a tarifa padrão tenha sido publicada; o MAI-Transcribe-2 em lote foi lançado a US$ 0,10 por hora de áudio na mesma base por tempo limitado. O streaming custa 5,4 vezes a tarifa do modo em lote.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, aproximadamente 4,4 bilhões de parâmetros em BF16, disponível para download, ajustável com fine-tuning e servível em um único acelerador. Sem preço, sem SLA e sem compromisso de suporte, porque não há um serviço por trás disso.
Essas duas frases contêm a decisão. Um serviço de pré-visualização com tarifa introdutória e preço padrão não divulgado é um compromisso que expira; o prêmio de 5,4× para streaming e a janela até 2026 estão ambos nas mãos da Microsoft para alterar, e a proporção entre lote e streaming é o número a observar quando o preço padrão entrar em vigor. Pesos Apache 2.0 sem anúncio são o oposto: um artefato que ninguém pode retirar, atrelado a uma relação com fornecedor que ninguém descreveu. Se o checkpoint será mantido é impossível saber, mas o arquivo que você tem hoje continua funcionando de qualquer forma.
A restrição específica do setor costuma ser a que decide estas questões na prática. Uma implementação de call center em árabe dentro de uma instituição regulamentada pode não conseguir sequer enviar áudio para um endpoint de pré-visualização na nuvem; uma equipa que já adotou o Azure AI Speech como padrão pode não querer uma segunda pilha local para uma única família de idiomas. Ambas as restrições são legítimas, e nenhuma delas tem qualquer relação com os valores de 2,5% e 8,82% que encabeçam os dois lançamentos.
Acima da camada de transcrição, o mesmo ponto se aplica a ambos. O OrcaRouter não roteia nenhum desses modelos de fala — esta é uma comparação de dois sistemas que não atendemos —, mas o sumarizador, o classificador ou o agente que consome a transcrição é roteável: mais de 200 modelos em uma única chave de API pelo preço de tabela do provedor com 0% de margem, de modo que uma mudança de preço do fornecedor chega ao nosso lado no mesmo dia, e failover automático se um provedor degradar. Onde isso ajuda especificamente aqui é na fase de teste: apontar ambos os candidatos de transcrição para um único pipeline downstream, atrás de uma única chave, é como você faz o confronto direto sem montar duas integrações.
O teste que resolveria isso
Nenhum dos fornecedores publicou desempenho específico para o árabe, e nenhum foi avaliado de forma independente com áudio dialetal. A comparação, portanto, resume-se a três fatos e uma recomendação.
Os fatos: o modelo de streaming da Microsoft é mais rápido, em 0,13 segundos, e afirma ter melhor precisão agregada num placar que ainda não o plotou; o modelo da Mistral publica uma lista de dialetos, uma taxa de erro em árabe e o código de normalização para recalculá-la, em 480 milissegundos; e os dois valores de precisão não podem ser comparados, porque um deles é taxa de erro de palavra e o outro é taxa de erro de caractere num corpus diferente.
A recomendação: quem estiver tomando essa decisão deveria executar os dois nos próprios áudios, porque essa é a única medição que ambos os fornecedores deixaram em aberto. Monte o conjunto de avaliação a partir de gravações reais — a mistura de dialetos que você realmente recebe, o codec que você realmente usa, o vocabulário de domínio de que você realmente precisa — e pontue ambos com a normalização da Mistral contra uma referência em que você confia. Um teste de duas horas com as suas próprias gravações lhe dirá mais do que os dois posts de lançamento somados, e é a única forma de descobrir se a vantagem de 0,13 segundo vale uma dependência de prévia e um prêmio de streaming de 5,4×, ou se um modelo de 4,4B para download a 480 milissegundos já é bom o suficiente para a tarefa.

A OrcaRouter não atende nenhum desses modelos de fala, e este artigo não sugere o contrário — o que ele aborda é a camada de linguagem que lê a transcrição: mais de 200 modelos por trás de uma única chave ao preço de tabela do fornecedor, com 0% de margem, de modo que uma mudança de preço do fornecedor no modelo a jusante chega até você no dia em que é anunciada.
Failover automático permite que ambos os candidatos de transcrição alimentem um único pipeline downstream em vez de duas integrações, o que também é a maneira mais barata de executar a comparação direta.
