Una scheda del titolo generata per Microsoft-Decision-1 vs Kev, sottotitolata 'uno scorer ospitato contro una ricetta che puoi riaddestrare', con chip che riportano: API ospitata da 9B vs una base congelata più un adattatore LoRA rank-16 da 33,8M; nessun benchmark pubblicato vs ECE 0,017 su transfer-v4; nessun peso distribuito vs Apache-2.0; e un footer di provenienza che segnala che entrambe le serie di cifre sono autodichiarate.
Engineering & Research

Microsoft-Decision-1 vs Kev: acquistare un punteggio o possedere la ricetta che lo produce

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Jared Palmer ha messo una ricevuta accanto al suo modello. La famiglia Kev — Kev-0.8B, Kev-4B e Kev-9B, costruita su checkpoint di base open-weight congelati con un adattatore LoRA rank-16 e una piccola testa pointer — è stata rilasciata il 24 settembre 2026 con la sua ricetta di addestramento, i suoi conteggi dei dati fase per fase e i suoi numeri di valutazione tutti pubblicati, e il messaggio onesto per chiunque lo confronti con Microsoft-Decision-1 è che Kev ti dice molto di più su come riprodurre se stesso. Lo scorer di Microsoft è diventato disponibile a livello generale su Microsoft Foundry l'8 ottobre 2026: una base Qwen3.5-9B post-addestrata da Microsoft, contesto di 32.768 token, solo testo, pesi non distribuiti, una metodologia di valutazione pubblicata e nessun risultato pubblicato. Entrambi prendono uno stato e un insieme di domande tipizzate e restituiscono una distribuzione calibrata invece di testo generato. Uno è un servizio, l'altro è un metodo che puoi eseguire in un notebook stasera.

Il motivo per cui a decidere questo confronto è questa distinzione e non la capacità: Kev-4B riporta un ECE di 0,017 sul suo test out-of-domain bloccato, mentre Microsoft-Decision-1 non riporta nulla; così l'argomento della calibrazione che di solito dirime un confronto tra scorer ha una sola parte che dichiara la propria posizione.

Quello che Kev pubblica davvero

La card di Kev-4B è insolitamente specifica, e la specificità è il punto. La backbone è Qwen3.5-4B-Base, congelata a una revisione denominata, con 24 layer di attenzione lineare Gated DeltaNet e 8 layer di full attention a dimensione nascosta 2.560. Sopra vi è un adattatore LoRA di rango 16 — 33,8 milioni di parametri addestrabili, applicati alle proiezioni di attention, MLP e DeltaNet — e una pointer head che assegna un punteggio al token di chiusura di ciascuna opzione rispetto al token finale della domanda e applica una softmax. Una temperatura, T = 2,41, è memorizzata nel file della head e applicata al caricamento, e la card fornisce il valore adattato e l'hash del file. L'addestramento si è svolto per fasi con conteggi dei record pubblicati: una ricetta di base di 12.576 record, 1.425 per date ed evidenze mancanti, 5.219 narrazioni reali di reclami CFPB, 6.000 record di skill e 5.320 record di tooling per sviluppatori, con le fasi successive che ripropongono quelle precedenti. La card dichiara anche ciò che non è stato utilizzato: «Nessun output di Jev (modello decisionale ospitato di TypeSafe) è stato utilizzato.»

La tabella di benchmark è riportata sulla stessa pagina e viene fornita con i casi di fallimento allegati, cosa più rara dei successi. Test out-of-domain bloccato di Transfer-v4: accuratezza 0,838, Brier 0,224, ECE 0,017. Breadth-v1 su 14 dataset di hold-out e 3.089 domande: accuratezza 0,690, ECE 0,029. Test Hard-v1: 0,803. Test Documents-v1: 0,903. MMLU-Pro con dieci opzioni: 0,565. Aritmetica delle date: 0,65, indicata dall'autore come l'area più debole, con un flag del preprocessore offerto come correzione parziale e una nota esplicita che non è stata rimisurata. La sezione sui limiti aggiunge che la calibrazione è una singola temperatura in-distribution, quindi la copertura si degrada fuori dominio; che l'ordine delle opzioni può ribaltare una risposta; e che lunghezze oltre 8.192 token vengono servite ma non convalidate. Sono pubblicate anche le cifre di serving: 18,1 ms per sei domande su uno stato breve su una H100, 12,9 ms in cache, 14,3 GB di memoria GPU residente.

A generated two-column scoreboard for Microsoft-Decision-1 and Kev across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus a frozen Qwen3.5-4B-Base with a 33.8M rank-16 LoRA adapter and pointer head; weights not distributed versus Apache-2.0 download; context 32,768 tokens versus 8,192 validated and 65,536 served; published scores none versus vendor-reported ECE 0.017 on transfer-v4 with Brier 0.224; tuning not available versus the full training recipe published with per-stage record counts; and price a Foundry per-token rate versus free to self-host. A footer reads that both sets of figures are self-reported by their publishers.

Ciò che Microsoft pubblica invece

Microsoft-Decision-1 copre gran parte degli stessi ambiti con un'impostazione diversa. Valuta domande sì/no, a scelta multipla, di valutazione, di classificazione e a rubrica, supporta opzioni esplicite di astensione come "non posso dirlo", restituisce probabilità JSON e viene eseguito in un'unica invocazione su un massimo di 32K token — quattro volte il contesto che Kev convalida. È distribuito come API ospitata in Microsoft Foundry nell'ambito del portfolio Direct from Azure, con distribuzione serverless e a endpoint unificato, SKU standard, autenticazione Azure e un percorso di fatturazione unificato. L'inferenza batch è disabilitata e non esistono né download dei pesi né un percorso di fine-tuning.

La sezione di valutazione descrive benchmark decisionali pubblici e della community, oltre a set interni tenuti da parte, metriche tra cui accuratezza ed errore di calibrazione, ordine delle opzioni variato, test statistici appaiati e l'affermazione che il modello "si comporta alla pari dei principali modelli decisionali e supera altri modelli decisionali aperti valutati con la stessa metodologia". Non c'è alcuna tabella. La model card dichiara onestamente i propri limiti — i punteggi variano con la formulazione e l'ordine delle opzioni, la calibrazione è più solida sui tipi di attività familiari, non vengono prodotte spiegazioni e la copertura per le lingue diverse dall'inglese è la più debole — ma un elenco di limiti non è una misurazione della calibrazione. Chiunque imposti una soglia di auto-accettazione di 0,9 su Microsoft-Decision-1 lo fa per fede e dovrà ritoccarla in produzione.

A screenshot of the Kev-4B model card on Hugging Face, read 10 October 2026, showing the jaredpalmer organisation, 114 likes, an apache-2.0 licence label, and the Model card, Files and versions and Community tabs above the Kev-4B heading and a Model summary section.

La parte del confronto che costa denaro

L'economia di Kev è il motivo per cui questo confronto è davvero equilibrato. La ricetta è una base congelata più un adapter da 33,8M, il che significa che il modello marginale che addestri costa un compute delle dimensioni di un adapter, non un compute delle dimensioni di un foundation model. Puoi tenere la base in memoria una volta e caricare diversi adapter — uno per dominio decisionale — che è una forma di deployment che l'API ospitata di Microsoft non può assolutamente esprimere. Se le tue regole di routing differiscono da quelle di un giudice generico, Kev ti permette di addestrare la differenza; Microsoft-Decision-1 ti permette di scrivere un prompt migliore e sperare.

Di contro, l'API ospitata non comporta alcuna superficie operativa. Non c'è alcun adapter da monitorare, nessuno stack di serving da mantenere caldo, nessun divario di contesto tra validato e servito su cui ragionare, e nessun rischio che una temperatura calibrata su un dataset si comporti diversamente sul vostro. Per un team il cui volume di decisioni è modesto, il servizio è l'artefatto più economico in ore di ingegneria, anche se i token costano denaro; per un team che assegna un punteggio a milioni di elementi al giorno, l'adapter self-hosted vince sul costo unitario nel momento in cui la GPU è pagata.

Esiste una terza via che non utilizza nessuno dei due modelli nella parte in cui ciascuno è più debole, ed è lì che si colloca OrcaRouter. Non ospitiamo Microsoft-Decision-1 né Kev — uno scorer che restituisce probabilità non è un target di chat-completions e nessuno dei due modelli è nel nostro catalogo. La metà generativa di una pipeline decisionale è ciò che mettiamo a disposizione: il modello che redige la risposta candidata, scrive la rubrica o emette la chiamata di tool che viene valutata. Tutto questo sta dietro un'unica chiave compatibile con OpenAI, con più di 200 modelli al prezzo di listino del provider, trasferito con 0% di markup, così una variazione di prezzo di un fornitore è attiva dalla nostra parte lo stesso giorno. Se stai costruendo un ciclo di valutazione o di triage, la chiamata di scrittura è instradabile e la chiamata di scoring no, e mantenere chiaro questo confine è ciò che impedisce a una pipeline di scoring di trasformarsi silenziosamente in una pipeline di chat.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Kev nor Microsoft-Decision-1 appears, because neither is a chat-completions target.

Come decidere

Scegli Kev quando hai bisogno di numeri prima di spedire, quando vuoi fare fine-tuning sulle tue etichette decisionali, quando vuoi eseguire lo scoring all'interno del tuo perimetro a costo marginale zero, o quando vuoi che più domini decisionali condividano un unico modello di base residente. Le sue cifre ECE pubblicate sono ancora le misurazioni dell'autore sul suo stesso harness — considerale un'autovalutazione credibile, non un risultato verificato da terzi — ma sono almeno una scala dichiarata che puoi provare a riprodurre, e la ricetta è lì, pronta per riprodurle.

Scegli Microsoft-Decision-1quando il criterio è l'approvvigionamento o la lunghezza del contesto: un endpoint Azure gestito con fatturazione unificata e un pacchetto Responsible AI, 32K di input per documenti lunghi e un fornitore a cui rivolgersi in caso di escalation. La sua tabella di benchmark mancante non è uno scandalo — molti modelli ospitati vengono lanciati senza di essa — ma significa che la prima curva di calibrazione per questo modello sarà tracciata dai suoi utenti, e dovresti pianificare di essere uno di loro, sui tuoi dati etichettati, prima di applicarvi una soglia di produzione.