Um cartão de título gerado para Microsoft-Decision-1 vs Kev, com o subtítulo "um scorer hospedado contra uma receita que você pode retreinar", com chips que dizem API hospedada de 9B vs uma base congelada mais um adaptador LoRA rank-16 de 33,8M, nenhum benchmark publicado vs ECE 0,017 no transfer-v4, nenhum peso distribuído vs Apache-2.0, e um rodapé de fontes observando que ambos os conjuntos de números são autorrelatados.
Engineering & Research

Microsoft-Decision-1 vs Kev: Comprar uma pontuação, ou ser dono da receita que a produz

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Jared Palmer colocou um recibo ao lado do seu modelo. A família Kev — Kev-0.8B, Kev-4B e Kev-9B, construída sobre checkpoints base de pesos abertos congelados com um adaptador LoRA de rank 16 e uma pequena cabeça de ponteiro — foi lançada em 24 de setembro de 2026 com sua receita de treinamento, suas contagens de dados estágio por estágio e seus números de avaliação, todos publicados, e a manchete honesta para quem a compara comMicrosoft-Decision-1 é que o Kev diz muito mais sobre como reproduzir a si mesmo. O scorer da Microsoft ficou disponível para o público em geral no Microsoft Foundry em 8 de outubro de 2026: uma base Qwen3.5-9B pós-treinada pela Microsoft, contexto de 32.768 tokens, somente texto, pesos não distribuídos, uma metodologia de avaliação publicada e nenhum resultado publicado. Ambos recebem um estado e um conjunto de perguntas tipadas e retornam uma distribuição calibrada em vez de texto gerado. Um é um serviço, o outro é um método que você pode executar em um notebook hoje à noite.

A razão pela qual essa distinção decide este confronto, e não a capacidade, é que: Kev-4B reporta ECE 0,017 em seu teste bloqueado fora do domínio, e Microsoft-Decision-1 não reporta nada, então o argumento de calibração que normalmente resolve uma comparação entre pontuadores tem apenas um lado declarando sua posição.

O que Kev realmente publica

O cartão do Kev-4B é excepcionalmente específico, e a especificidade é o ponto. A espinha dorsal é o Qwen3.5-4B-Base, congelado em uma revisão nomeada, com 24 camadas de atenção linear Gated DeltaNet e 8 camadas de atenção completa em tamanho oculto 2.560. Sobre ele, há um adaptador LoRA de rank 16 — 33,8 milhões de parâmetros treináveis, aplicado às projeções de atenção, MLP e DeltaNet — e uma cabeça de ponteiro que pontua o token de fechamento de cada opção em relação ao token final da pergunta e aplica softmax. Uma temperatura, T = 2,41, é armazenada no arquivo da cabeça e aplicada no carregamento, e o cartão fornece o valor ajustado e o hash do arquivo. O treinamento ocorreu em estágios com contagens de registros publicadas: uma receita base de 12.576 registros, 1.425 para datas e evidências ausentes, 5.219 narrativas reais de reclamações do CFPB, 6.000 registros de habilidades e 5.320 registros de ferramentas de desenvolvimento, com estágios posteriores repetindo os anteriores. O cartão também declara o que não foi usado: "Nenhuma saída do Jev (modelo de decisão hospedado da TypeSafe) foi usada."

A tabela de benchmark é apresentada na mesma página e vem acompanhada dos casos de falha, o que é mais raro do que os casos de sucesso. Teste bloqueado fora do domínio do Transfer-v4: acurácia 0,838, Brier 0,224, ECE 0,017. Breadth-v1 em 14 conjuntos de dados retidos e 3.089 perguntas: acurácia 0,690, ECE 0,029. Teste do Hard-v1: 0,803. Teste do Documents-v1: 0,903. MMLU-Pro com dez opções: 0,565. Aritmética de datas: 0,65, apontada pelo autor como a área mais fraca, com uma flag de pré-processador oferecida como correção parcial e uma nota explícita de que não foi medida novamente. A seção de limitações acrescenta que a calibração é uma única temperatura em distribuição, de modo que a cobertura se degrada fora do domínio, que a ordem das opções pode inverter uma resposta e que comprimentos além de 8.192 tokens são atendidos, mas não validados. Os números de serving também são publicados: 18,1 ms para seis perguntas sobre um estado curto em uma H100, 12,9 ms em cache, 14,3 GB de memória de GPU residente.

A generated two-column scoreboard for Microsoft-Decision-1 and Kev across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus a frozen Qwen3.5-4B-Base with a 33.8M rank-16 LoRA adapter and pointer head; weights not distributed versus Apache-2.0 download; context 32,768 tokens versus 8,192 validated and 65,536 served; published scores none versus vendor-reported ECE 0.017 on transfer-v4 with Brier 0.224; tuning not available versus the full training recipe published with per-stage record counts; and price a Foundry per-token rate versus free to self-host. A footer reads that both sets of figures are self-reported by their publishers.

O que a Microsoft publica em vez disso

Microsoft-Decision-1 cobre a maior parte do mesmo âmbito com uma postura diferente. Avalia perguntas de sim/não, escolha múltipla, avaliação, classificação e rubrica, suporta opções explícitas de abstenção como "não é possível dizer", devolve probabilidades em JSON e é executado numa única invocação em até 32K tokens — quatro vezes o contexto que o Kev valida. É distribuído como uma API hospedada no Microsoft Foundry, no âmbito do portfólio Direct from Azure, com implementação sem servidor e de ponto final unificado, SKU padrão, autenticação Azure e um caminho de faturação unificado. A inferência em lote está desativada, e não há download de pesos nem caminho de ajuste fino.

A seção de avaliação descreve benchmarks de decisão públicos e comunitários, além de conjuntos internos reservados, métricas incluindo acurácia e erro de calibração, ordem das opções variada, testes estatísticos pareados e a alegação de que o modelo "tem desempenho equivalente ao de modelos de decisão líderes e à frente de outros modelos de decisão abertos avaliados com a mesma metodologia". Não há tabela. A ficha do modelo reconhece honestamente seus próprios limites — as pontuações mudam com a formulação e a ordem das opções, a calibração é mais forte em tipos de tarefa familiares, não são produzidas explicações e a cobertura em idiomas que não o inglês é a mais fraca —, mas uma lista de limitações não é uma medição de calibração. Qualquer pessoa que defina um limiar de autoaceitação de 0,9 no Microsoft-Decision-1 está definindo-o com base na fé e ajustando-o em produção.

A screenshot of the Kev-4B model card on Hugging Face, read 10 October 2026, showing the jaredpalmer organisation, 114 likes, an apache-2.0 licence label, and the Model card, Files and versions and Community tabs above the Kev-4B heading and a Model summary section.

A parte da comparação que custa dinheiro

A economia do Kev é o motivo pelo qual este confronto é genuinamente equilibrado. A receita é uma base congelada mais um adaptador de 33,8M, o que significa que o modelo marginal que você treina custa computação do tamanho de um adaptador, não computação do tamanho de um modelo de fundação. Você pode manter a base na memória uma vez e carregar vários adaptadores — um por domínio de decisão —, uma forma de implantação que a API hospedada da Microsoft não consegue expressar de modo algum. Se suas regras de roteamento diferem das de um juiz genérico, o Kev permite que você treine a diferença; o Microsoft-Decision-1 permite que você escreva um prompt melhor e torça.

Em contrapartida, a API hospedada não carrega nenhuma superfície operacional. Não há adaptador para rastrear, nem pilha de serviço para manter aquecida, nem lacuna de contexto entre validado e servido sobre a qual raciocinar, e nenhum risco de que uma temperatura ajustada em um conjunto de dados se comporte de forma diferente no seu. Para uma equipe cujo volume de decisões é modesto, o serviço é o artefato mais barato em horas de engenharia, mesmo que os tokens custem dinheiro; para uma equipe que pontua milhões de itens por dia, o adaptador auto-hospedado ganha em custo unitário no momento em que a GPU é paga.

Há um terceiro caminho que não usa nenhum dos dois modelos na parte em que ele é mais fraco, e é aí que o OrcaRouter se posiciona. Não hospedamos o Microsoft-Decision-1 nem o Kev — um scorer que devolve probabilidades não é um alvo de chat-completions e nenhum dos dois modelos está no nosso catálogo. A metade generativa de um pipeline de decisão é o que nós oferecemos: o modelo que redige a resposta candidata, escreve a rubrica ou emite a chamada de ferramenta que será pontuada. Tudo isso está por trás de uma única chave compatível com OpenAI, com mais de 200 modelos nela ao preço de lista do provedor, repassado com 0% de markup, então uma mudança de preço do fornecedor fica ativa do nosso lado no mesmo dia. Se você está construindo um loop de avaliação ou de triagem, a chamada de escrita é roteável e a chamada de pontuação não é, e manter essa fronteira clara é o que impede que um pipeline de pontuação se torne silenciosamente um pipeline de chat.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Kev nor Microsoft-Decision-1 appears, because neither is a chat-completions target.

Como decidir

Escolha Kev quando você precisa de números antes de colocar em produção, quando quer fazer um ajuste fino com seus próprios rótulos de decisão, quando quer executar a pontuação dentro da sua própria fronteira a custo marginal zero, ou quando quer que vários domínios de decisão compartilhem um único modelo base residente. Seus números de ECE publicados ainda são medições do próprio autor, feitas no harness do próprio autor — trate-os como uma autoavaliação crível, não como um resultado auditado por terceiros —, mas são, pelo menos, uma escala declarada que você pode tentar reproduzir, e a receita está ali mesmo para reproduzi-los com ela.

Escolha Microsoft-Decision-1 quando o critério de decisão for compras ou comprimento de contexto: um endpoint gerenciado no Azure, com faturamento unificado e um pacote de IA Responsável, 32K de entrada para documentos longos e um fornecedor a quem recorrer. A ausência de uma tabela de benchmarks não é um escândalo — muitos modelos hospedados são lançados sem uma —, mas significa que a primeira curva de calibração desse modelo será traçada por seus usuários, e você deve planejar ser um deles, com seus próprios dados rotulados, antes de apontar um limite de produção para ele.