Um cartão de título gerado para Microsoft-Decision-1 vs Liquid AI d1-omni-600M, com o subtítulo 'a mais ampla superfície de sensores da categoria contra a lista de entradas mais estreita', com chips indicando 587M parâmetros com visão e áudio, uma Foundry API apenas de texto, 30 segundos de fala contra 32.768 tokens de texto, um codificador bidirecional contra um decodificador pós-treinado, e nenhuma calibração publicada em nenhum dos lados.
Engineering & Research

Microsoft-Decision-1 vs Liquid AI d1-omni-600M: Um pontuador que ouve contra um pontuador que apenas lê

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Você está encaminhando sinistros em um balcão de seguros, e o arquivo chega como três coisas: um PDF, uma fotografia de uma porta amassada e uma chamada telefônica de noventa segundos. Liquid AI d1-omni-600M pode ler o documento, olhar a foto e ouvir a chamada, e então responder a um conjunto de perguntas que você escreveu antecipadamente — isto está coberto, qual categoria, qual a gravidade, em uma escala de dois a dez — em uma única passagem, sem texto gerado e nada para analisar. Microsoft-Decision-1 pode ler o documento. Ele tornou-se disponível para o público em geral no Microsoft Foundry em 8 de outubro de 2026 como um pontuador hospedado, somente texto, pós-treinado no Qwen3.5-9B com uma janela de 32.768 tokens, e sua superfície de entrada termina aí: sem imagem, sem áudio, sem vídeo. Ambos retornam probabilidades calibradas sobre opções que você fornece, ambos emitem zero tokens de saída, e nenhum dos dois publicou um número de calibração.

Essa última frase compartilhada é a parte incômoda desta comparação. Os dois são os modelos de decisão com o sensor mais largo e com o sensor mais estreito a serem lançados este mês e, apesar de toda a distância arquitetônica entre eles, chegaram exatamente à mesma posição probatória: pesos reais ou um endpoint real, contratos documentados e nenhum número que alguém fora do fornecedor possa apontar quando alguém pergunta se as probabilidades são confiáveis.

Duas ancestralidades, não dois tamanhos

O número de 587M convida a interpretar o Liquid AI d1-omni-600M como um parente encolhido dos modelos que este blog já abordou. Não é o caso. O modelo é treinado a partir de LFM2.5-Encoder-350M, um codificador bidirecional, com um tronco compartilhado e cabeça de decisão de 381M, um codificador de visão de 94M retirado da linha LFM2.5-VL-450M e um FastConformer de 17 camadas para áudio. O Microsoft-Decision-1 é uma linhagem totalmente diferente: um decodificador Qwen3.5-9B, pós-treinado pela Microsoft, hospedado na Foundry, pesos não distribuídos e nenhuma via de ajuste fino oferecida.

Bidirecional versus decodificador é o fato arquitetural que decide como cada um se comporta, e também é por isso que as contagens de parâmetros são uma distração. Um codificador bidirecional lê todo o estado de uma vez, o que é o formato certo para um julgamento sobre uma entrada fixa; um decodificador pós-treinado abre mão do caminho de geração, mas mantém o tokenizador, a janela e o empacotamento empresarial que vêm com uma implantação de foundry. Nenhum dos dois é uma versão ampliada do outro, e eles não podem ser trocados um pelo outro, não importa como se leia uma tabela de benchmark.

O que a lista de entrada realmente lhe rende

É aqui que o d1-omni-600M mais se distancia de tudo o resto na categoria, e onde uma afirmação precisa ser lida com cuidado.

• Fala — O Liquid AI d1-omni-600M aceita texto mais até 30 segundos de fala e emite uma decisão sobre isso, o que nenhum avaliador apenas de texto consegue fazer em qualquer nível de precisão. As modalidades não textuais do Microsoft-Decision-1 não existem.

• Exclusão mútua — o d1-omni-600M lança um ValueError se imagens e áudio chegarem na mesma requisição. A maior superfície de sensores da categoria ainda é uma modalidade não textual por vez, o que é uma restrição real nessa mesa

• Corte — seu cartão informa 16.384 posições combinadas de texto, imagem e áudio, e acrescenta que, com imagens presentes, o texto de estado e da pergunta é reduzido para 896 tokens para corresponder ao treinamento. Qualquer documento ao qual você anexe uma foto está competindo com esse corte. Os 32.768 tokens do Microsoft-Decision-1 são todos de texto e não são cortados.

• Formatos — o d1-omni-600M tem três tipos de pergunta: noul para uma decisão binária que retorna P(sim) entre 0 e 1, choice para um rótulo de um conjunto que você nomeia com uma confiança e uma probabilidade por opção, e score para uma posição em uma escala ordenada de dois a dez níveis com sua distribuição. Várias perguntas dependem de um estado e são lidas em uma única passagem, e o contador de uso relata output_tokens: 0. A Microsoft documenta formatos de sim/não, múltipla escolha, avaliação, classificação e rubrica, além de uma opção de abstenção explicitamente suportada, como "não é possível dizer", quando as evidências são insuficientes — o único detalhe de design na página da Microsoft sem contrapartida direta aqui.

• Runtime — o d1-omni-600M traz código personalizado, precisa de trust_remote_code=True, e seu card recomenda float16 na GPU, enquanto alerta que bfloat16 alterou a resposta principal em algumas linhas. Isso é uma sensibilidade em tempo de serving documentada pelo fornecedor, não um defeito. Microsoft-Decision-1 é um endpoint gerenciado onde o formato de implantação é sua única variável de runtime, e vale a pena notar que a inferência em lote está desabilitada: não há canal offline para amortizar uma execução de pontuação em massa.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Liquid AI d1-omni-600M. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; base post-trained Qwen3.5-9B decoder; inputs text only; context 32,768 tokens of text, untrimmed; weights not distributed; calibration not published. Right column Liquid AI d1-omni-600M rows read: availability uploaded October 7, 2026; base LFM2.5-Encoder-350M bidirectional encoder with 587M total; inputs text, images, or 30 seconds of speech, one non-text modality at a time; context 16,384 positions with text trimmed to 896 tokens when images are present; weights open under lfm1.0; calibration not published. A footer line reads that neither vendor has published an accuracy or calibration benchmark for these models.

A lacuna de evidências, em ambas as direções

A Liquid AI publicou a família aberta d1, incluindo o d1-omni-600M, em 7 de outubro de 2026, com um post de lançamento e um conjunto de documentação. O que não foi publicado é o número que tornaria concreta a alegação multimodal. Não há benchmark de precisão específico para sua própria capacidade principal — a qualidade de decisão de visão e áudio que justifica os encoders de 94M e 112M —, e a divisão de visão é omitida do material de avaliação divulgado. Também não é publicado nenhum número de latência, então a vazão do modelo é algo que você descobre no seu próprio hardware.

A posição da Microsoft é estruturalmente idêntica e está um passo mais adiante. Sua aba Benchmarks nomeia as métricas — acurácia, erro de calibração, recall de segurança, taxas de falsos positivos, consistência de equidade — afirma que a avaliação foi executada em benchmarks de decisão públicos e comunitários, além de conjuntos de teste internos reservados não usados no treinamento, que a ordem das opções foi variada, que testes estatísticos pareados foram aplicados, e alega que o modelo "tem desempenho equivalente ao de modelos de decisão líderes e está à frente de outros modelos de decisão abertos avaliados com a mesma metodologia". Não exibe nenhum dos resultados. Vinte e cinco idiomas são listados como suportados, incluindo japonês, coreano, árabe, vietnamita, tailandês, turco, híndi, bengali, suaíli, hebraico, persa e ucraniano, com o aviso franco de que cobertura, qualidade e calibração "podem variar conforme o idioma" e que os idiomas diferentes do inglês, especialmente os de baixos recursos, são um ponto fraco. A precificação também não está na página do modelo; ela remete para a página de preços da Microsoft.

Portanto, a comparação entre esses dois não é uma questão de evidência contra evidência. É uma escolha entre dois tipos de número ausente. A Liquid AI entregou a superfície do sensor e deixou a precisão dessa superfície sem medição pública. A Microsoft entregou o caminho de aquisição — autenticação do Azure, governança, uma avaliação de IA Responsável, uma metodologia documentada — e deixou a calibração de um produto de probabilidade não quantificada.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

A pergunta de calibração que nenhum dos dois responde

Para um modelo de decisão, a probabilidade é o produto. Tudo o que vem depois é um limiar: 0,7 escalona, 0,95 aceita automaticamente, e o custo de traçar essa linha errado é pago em decisões automatizadas ruins, e não em tokens. Nesta categoria, há pelo menos uma família que publica os números — os checkpoints Intern-Decision, da InternLM, imprimem valores de Brier e de erro de calibração esperado em seus model cards — e nenhum dos dois modelos deste artigo o faz. Essa assimetria é a razão prática para manter o leque amplo, em vez de se comprometer apenas com a arquitetura.

A boa notícia é que o teste é barato e não exige a cooperação do fornecedor. Reúna algumas centenas de casos rotulados que se pareçam com o seu tráfego real, escreva o esquema de perguntas que a sua aplicação realmente enviaria, execute os dois modelos sobre eles e calcule o erro de calibração esperado na saída. Você então saberá duas coisas que ninguém fora do fornecedor conhece atualmente: quão bem as probabilidades do Microsoft-Dec-1 acompanham a precisão dele nos seus dados, e se os caminhos de áudio e imagem do d1-omni-600M valem os codificadores que carregam. Os próprios pontos documentados da Microsoft apontam na mesma direção — valide em dados documentados, defina limiares a partir do custo dos seus erros, sempre inclua uma opção de abstenção, randomize a ordem das opções, mantenha um humano no circuito para as decisões.

Onde cada um se encaixa, e onde o OrcaRouter se encaixa

Microsoft-Decision-1 pertence a todos os casos em que o material decisório é texto e o obstáculo é a aquisição: um documento longo, um trecho recuperado, uma chamada de ferramenta proposta, uma resposta gerada sendo avaliada com base em uma rubrica, com autenticação do Azure, faturamento unificado e uma avaliação de fornecedor exigidos antes que qualquer coisa chegue à produção. É o instrumento mais restrito e o mais fácil de ser aprovado.

Liquid AI d1-omni-600M pertence a qualquer contexto em que o material decisivo não seja texto — uma foto anexada a um formulário, uma curta gravação de chamada, uma captura de tela — e em que você queira pesos lfm1.0 que possa executar e ajustar finamente dentro de um limite que você controla. É o instrumento mais abrangente e o mais difícil de validar, porque a alegação multimodal é exatamente a parte sem nenhum benchmark publicado por trás dela.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

Nenhum dos dois está no nosso catálogo, e nada aqui constitui uma afirmação de disponibilidade para qualquer um deles. Um modelo que devolve probabilidades em vez de texto não é algo para onde se encaminham chat completions, e ficar de fora do posto de pontuação é justamente todo o design do instrumento. O que o OrcaRouter oferece é o lado generativo do mesmo ciclo: os mais de 200 modelos por trás de uma única chave compatível com a OpenAI que escrevem a rubrica contra a qual o seu pontuador avalia, transcrevem ou resumem o material antes de ele se tornar um estado, e emitem a chamada de ferramenta que o seu pontuador aprova antes de ela ser executada. O preço de tabela do fornecedor é repassado com 0% de margem, então um corte de preço de um fornecedor no lado gerador entra em vigor no nosso no mesmo dia. O failover automático mantém esse lado vivo quando um único fornecedor se degrada — o que um pipeline que pontua cada documento recuperado percebe imediatamente — e, se você quiser vários redatores julgados em vez de um só, a DSL de roteamento os compõe em uma única chamada e a fusão de modelos reporta a concordância entre eles como um campo que o seu pontuador pode ler como qualquer outro.

Conclusão

A Microsoft-Decision-1 atingiu a disponibilidade geral no Microsoft Foundry a 8 de outubro de 2026: apenas texto, 32 768 tokens, baseado num Qwen3.5-9B pós-treinado, alojado sem pesos, sem preço na página do modelo, sem valor de latência e com uma secção de benchmarks que descreve a sua metodologia sem apresentar um resultado. O Liquid AI d1-omni-600M foi carregado a 7 de outubro de 2026 como um modelo de decisão de codificador bidirecional de 587M que lê texto, imagens ou 30 segundos de fala — uma modalidade não textual de cada vez, com o texto reduzido a 896 tokens quando estão presentes imagens — sob a licença lfm1.0, sem benchmark de exatidão para a sua capacidade principal, sem divisão de visão e sem latência publicada. Escolha com base na modalidade e no controlo, e não nas pontuações, porque as pontuações não existem: se o seu material for uma fotografia ou uma chamada telefónica, só um destes pode responder, e se for um documento de quarenta páginas com uma revisão de aquisição anexada, só o outro pode ser implementado.

O que o OrcaRouter carrega é o lado generativo do mesmo ciclo: os mais de 200 modelos por trás de uma única chave compatível com OpenAI que escrevem a rubrica com base na qual seu avaliador atribui notas, transcrevem ou resumem o material antes que ele se torne um estado, e emitem a chamada de ferramenta que seu avaliador aprova antes que ela seja executada.