
Microsoft-Decision-1 vs Kev: acquistare un punteggio o possedere la ricetta che lo produce
- OrcaNUOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M di token
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
Jared Palmer ha messo una ricevuta accanto al suo modello. La famiglia Kev — Kev-0.8B, Kev-4B e Kev-9B, costruita su checkpoint di base open-weight congelati con un adattatore LoRA rank-16 e una piccola testa pointer — è stata rilasciata il 24 settembre 2026 con la sua ricetta di addestramento, i suoi conteggi dei dati fase per fase e i suoi numeri di valutazione tutti pubblicati, e il messaggio onesto per chiunque lo confronti con Microsoft-Decision-1 è che Kev ti dice molto di più su come riprodurre se stesso. Lo scorer di Microsoft è diventato disponibile a livello generale su Microsoft Foundry l'8 ottobre 2026: una base Qwen3.5-9B post-addestrata da Microsoft, contesto di 32.768 token, solo testo, pesi non distribuiti, una metodologia di valutazione pubblicata e nessun risultato pubblicato. Entrambi prendono uno stato e un insieme di domande tipizzate e restituiscono una distribuzione calibrata invece di testo generato. Uno è un servizio, l'altro è un metodo che puoi eseguire in un notebook stasera.
Il motivo per cui a decidere questo confronto è questa distinzione e non la capacità: Kev-4B riporta un ECE di 0,017 sul suo test out-of-domain bloccato, mentre Microsoft-Decision-1 non riporta nulla; così l'argomento della calibrazione che di solito dirime un confronto tra scorer ha una sola parte che dichiara la propria posizione.
Quello che Kev pubblica davvero
La card di Kev-4B è insolitamente specifica, e la specificità è il punto. La backbone è Qwen3.5-4B-Base, congelata a una revisione denominata, con 24 layer di attenzione lineare Gated DeltaNet e 8 layer di full attention a dimensione nascosta 2.560. Sopra vi è un adattatore LoRA di rango 16 — 33,8 milioni di parametri addestrabili, applicati alle proiezioni di attention, MLP e DeltaNet — e una pointer head che assegna un punteggio al token di chiusura di ciascuna opzione rispetto al token finale della domanda e applica una softmax. Una temperatura, T = 2,41, è memorizzata nel file della head e applicata al caricamento, e la card fornisce il valore adattato e l'hash del file. L'addestramento si è svolto per fasi con conteggi dei record pubblicati: una ricetta di base di 12.576 record, 1.425 per date ed evidenze mancanti, 5.219 narrazioni reali di reclami CFPB, 6.000 record di skill e 5.320 record di tooling per sviluppatori, con le fasi successive che ripropongono quelle precedenti. La card dichiara anche ciò che non è stato utilizzato: «Nessun output di Jev (modello decisionale ospitato di TypeSafe) è stato utilizzato.»
La tabella di benchmark è riportata sulla stessa pagina e viene fornita con i casi di fallimento allegati, cosa più rara dei successi. Test out-of-domain bloccato di Transfer-v4: accuratezza 0,838, Brier 0,224, ECE 0,017. Breadth-v1 su 14 dataset di hold-out e 3.089 domande: accuratezza 0,690, ECE 0,029. Test Hard-v1: 0,803. Test Documents-v1: 0,903. MMLU-Pro con dieci opzioni: 0,565. Aritmetica delle date: 0,65, indicata dall'autore come l'area più debole, con un flag del preprocessore offerto come correzione parziale e una nota esplicita che non è stata rimisurata. La sezione sui limiti aggiunge che la calibrazione è una singola temperatura in-distribution, quindi la copertura si degrada fuori dominio; che l'ordine delle opzioni può ribaltare una risposta; e che lunghezze oltre 8.192 token vengono servite ma non convalidate. Sono pubblicate anche le cifre di serving: 18,1 ms per sei domande su uno stato breve su una H100, 12,9 ms in cache, 14,3 GB di memoria GPU residente.

Ciò che Microsoft pubblica invece
Microsoft-Decision-1 copre gran parte degli stessi ambiti con un'impostazione diversa. Valuta domande sì/no, a scelta multipla, di valutazione, di classificazione e a rubrica, supporta opzioni esplicite di astensione come "non posso dirlo", restituisce probabilità JSON e viene eseguito in un'unica invocazione su un massimo di 32K token — quattro volte il contesto che Kev convalida. È distribuito come API ospitata in Microsoft Foundry nell'ambito del portfolio Direct from Azure, con distribuzione serverless e a endpoint unificato, SKU standard, autenticazione Azure e un percorso di fatturazione unificato. L'inferenza batch è disabilitata e non esistono né download dei pesi né un percorso di fine-tuning.
La sezione di valutazione descrive benchmark decisionali pubblici e della community, oltre a set interni tenuti da parte, metriche tra cui accuratezza ed errore di calibrazione, ordine delle opzioni variato, test statistici appaiati e l'affermazione che il modello "si comporta alla pari dei principali modelli decisionali e supera altri modelli decisionali aperti valutati con la stessa metodologia". Non c'è alcuna tabella. La model card dichiara onestamente i propri limiti — i punteggi variano con la formulazione e l'ordine delle opzioni, la calibrazione è più solida sui tipi di attività familiari, non vengono prodotte spiegazioni e la copertura per le lingue diverse dall'inglese è la più debole — ma un elenco di limiti non è una misurazione della calibrazione. Chiunque imposti una soglia di auto-accettazione di 0,9 su Microsoft-Decision-1 lo fa per fede e dovrà ritoccarla in produzione.

La parte del confronto che costa denaro
L'economia di Kev è il motivo per cui questo confronto è davvero equilibrato. La ricetta è una base congelata più un adapter da 33,8M, il che significa che il modello marginale che addestri costa un compute delle dimensioni di un adapter, non un compute delle dimensioni di un foundation model. Puoi tenere la base in memoria una volta e caricare diversi adapter — uno per dominio decisionale — che è una forma di deployment che l'API ospitata di Microsoft non può assolutamente esprimere. Se le tue regole di routing differiscono da quelle di un giudice generico, Kev ti permette di addestrare la differenza; Microsoft-Decision-1 ti permette di scrivere un prompt migliore e sperare.
Di contro, l'API ospitata non comporta alcuna superficie operativa. Non c'è alcun adapter da monitorare, nessuno stack di serving da mantenere caldo, nessun divario di contesto tra validato e servito su cui ragionare, e nessun rischio che una temperatura calibrata su un dataset si comporti diversamente sul vostro. Per un team il cui volume di decisioni è modesto, il servizio è l'artefatto più economico in ore di ingegneria, anche se i token costano denaro; per un team che assegna un punteggio a milioni di elementi al giorno, l'adapter self-hosted vince sul costo unitario nel momento in cui la GPU è pagata.
Esiste una terza via che non utilizza nessuno dei due modelli nella parte in cui ciascuno è più debole, ed è lì che si colloca OrcaRouter. Non ospitiamo Microsoft-Decision-1 né Kev — uno scorer che restituisce probabilità non è un target di chat-completions e nessuno dei due modelli è nel nostro catalogo. La metà generativa di una pipeline decisionale è ciò che mettiamo a disposizione: il modello che redige la risposta candidata, scrive la rubrica o emette la chiamata di tool che viene valutata. Tutto questo sta dietro un'unica chiave compatibile con OpenAI, con più di 200 modelli al prezzo di listino del provider, trasferito con 0% di markup, così una variazione di prezzo di un fornitore è attiva dalla nostra parte lo stesso giorno. Se stai costruendo un ciclo di valutazione o di triage, la chiamata di scrittura è instradabile e la chiamata di scoring no, e mantenere chiaro questo confine è ciò che impedisce a una pipeline di scoring di trasformarsi silenziosamente in una pipeline di chat.

Come decidere
Scegli Kev quando hai bisogno di numeri prima di spedire, quando vuoi fare fine-tuning sulle tue etichette decisionali, quando vuoi eseguire lo scoring all'interno del tuo perimetro a costo marginale zero, o quando vuoi che più domini decisionali condividano un unico modello di base residente. Le sue cifre ECE pubblicate sono ancora le misurazioni dell'autore sul suo stesso harness — considerale un'autovalutazione credibile, non un risultato verificato da terzi — ma sono almeno una scala dichiarata che puoi provare a riprodurre, e la ricetta è lì, pronta per riprodurle.
Scegli Microsoft-Decision-1quando il criterio è l'approvvigionamento o la lunghezza del contesto: un endpoint Azure gestito con fatturazione unificata e un pacchetto Responsible AI, 32K di input per documenti lunghi e un fornitore a cui rivolgersi in caso di escalation. La sua tabella di benchmark mancante non è uno scandalo — molti modelli ospitati vengono lanciati senza di essa — ma significa che la prima curva di calibrazione per questo modello sarà tracciata dai suoi utenti, e dovresti pianificare di essere uno di loro, sui tuoi dati etichettati, prima di applicarvi una soglia di produzione.
