Сгенерированная титульная карточка для Microsoft-Decision-1 против Kev с подзаголовком «хостинговый скорер против рецепта, который можно переобучить», с плашками: «хостинговый API 9B» против «замороженная база плюс LoRA-адаптер rank-16 на 33.8M», «без опубликованных бенчмарков» против «ECE 0.017 на transfer-v4», «веса не распространяются» против «Apache-2.0», и нижний колонтитул с указанием источников, отмечающий, что оба набора цифр приведены по данным самих сторон.
Engineering & Research

Microsoft-Decision-1 vs Kev: покупка оценки или владение рецептом, который её производит

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Джаред Палмер положил чек рядом со своей моделью. Семейство Kev — Kev-0.8B, Kev-4B и Kev-9B, построенное на замороженных базовых чекпойнтах с открытыми весами, с адаптером LoRA ранга 16 и небольшим pointer-head, — вышло 24 сентября 2026 года, причём его рецепт обучения, постадийные объёмы данных и метрики оценки опубликованы, и честная главная мысль для всех, кто сравнивает его с Microsoft-Decision-1, состоит в том, что Kev рассказывает гораздо больше о том, как воспроизвести себя. Оценщик Microsoft стал общедоступен в Microsoft Foundry 8 октября 2026 года: база Qwen3.5-9B, дообученная Microsoft, контекст 32 768 токенов, только текст, веса не распространяются, методология оценки опубликована, а результаты — нет. И то, и другое принимает состояние и набор типизированных вопросов и возвращает калиброванное распределение вместо сгенерированного текста. Одно — сервис, другое — метод, который можно запустить в блокноте уже сегодня вечером.

Причина, по которой исход этого противостояния решает именно это различие, а не возможности: Kev-4B сообщает ECE 0,017 на своём закрытом тесте вне домена, а Microsoft-Decision-1 не сообщает ничего, поэтому аргумент о калибровке, который обычно разрешает сравнение скорера со скорером, подкреплён позицией только одной стороны.

Что Kev на самом деле публикует

Карточка Kev-4B необычно конкретна, и конкретность здесь — суть. Основа — Qwen3.5-4B-Base, замороженная на именованной ревизии, с 24 слоями линейного внимания Gated DeltaNet и 8 слоями полного внимания при размере скрытого слоя 2 560. Поверх неё находится LoRA-адаптер ранга 16 — 33,8 млн обучаемых параметров, применённый к проекциям внимания, MLP и DeltaNet — и голова-указатель, которая оценивает закрывающий токен каждого варианта относительно финального токена вопроса и применяет softmax. Одна температура, T = 2.41, хранится в файле головы и применяется при загрузке, а карточка приводит подобранное значение и хеш файла. Обучение проходило поэтапно с опубликованными количествами записей: базовый рецепт из 12 576 записей, 1 425 для дат и недостающих доказательств, 5 219 реальных нарративов жалоб CFPB, 6 000 записей навыков и 5 320 записей инструментов разработчика, при этом более поздние этапы повторяли более ранние. Карточка также указывает, что не использовалось: «Ни один вывод Jev (хостируемой модели принятия решений TypeSafe) не использовался».

Таблица бенчмарка приведена на той же странице, и к ней прилагаются примеры неудач — это встречается реже, чем примеры успехов. Зафиксированный тест Transfer-v4 вне домена: точность 0,838, Brier 0,224, ECE 0,017. Breadth-v1 на 14 отложенных наборах данных и 3 089 вопросах: точность 0,690, ECE 0,029. Тест Hard-v1: 0,803. Тест Documents-v1: 0,903. MMLU-Pro с десятью вариантами: 0,565. Арифметика дат: 0,65, названная автором самой слабой областью, с флагом препроцессора, предложенным в качестве частичного исправления, и явным примечанием, что её не переизмеряли. В разделе ограничений также отмечается, что калибровка — это единственная температура в пределах распределения, поэтому покрытие ухудшается вне домена, что порядок вариантов может изменить ответ и что длины свыше 8 192 токенов обслуживаются, но не валидируются. Показатели обслуживания тоже опубликованы: 18,1 мс для шести вопросов при коротком состоянии на H100, 12,9 мс при кэшировании, 14,3 ГБ резидентной памяти GPU.

A generated two-column scoreboard for Microsoft-Decision-1 and Kev across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus a frozen Qwen3.5-4B-Base with a 33.8M rank-16 LoRA adapter and pointer head; weights not distributed versus Apache-2.0 download; context 32,768 tokens versus 8,192 validated and 65,536 served; published scores none versus vendor-reported ECE 0.017 on transfer-v4 with Brier 0.224; tuning not available versus the full training recipe published with per-stage record counts; and price a Foundry per-token rate versus free to self-host. A footer reads that both sets of figures are self-reported by their publishers.

Что вместо этого публикует Microsoft

Microsoft-Decision-1 охватывает большую часть той же области, но с другим подходом. Он оценивает вопросы с ответами «да/нет», с множественным выбором, рейтинговые, классификационные и рубричные вопросы, поддерживает явные варианты воздержания, такие как «не могу сказать», возвращает вероятности в формате JSON и выполняется за один вызов при объёме до 32K токенов — в четыре раза больше контекста, который проверяет Kev. Он распространяется как размещённый API в Microsoft Foundry в рамках портфеля Direct from Azure, с бессерверным развёртыванием и развёртыванием с унифицированной конечной точкой, стандартным SKU, аутентификацией Azure и унифицированным способом выставления счетов. Пакетный вывод отключён, загрузка весов недоступна, и нет возможности тонкой настройки.

В разделе оценки описываются публичные и общественные бенчмарки для принятия решений, а также отложенные внутренние наборы, метрики, включая точность и ошибку калибровки, варьирование порядка вариантов, парные статистические тесты и утверждение, что модель «работает на уровне ведущих моделей принятия решений и опережает другие открытые модели принятия решений, оценённые по той же методологии». Таблицы нет. В карточке модели честно перечислены её собственные ограничения — оценки меняются в зависимости от формулировок и порядка вариантов, калибровка наиболее сильна на знакомых типах задач, пояснения не генерируются, а покрытие неанглийских языков самое слабое — но список ограничений не является измерением калибровки. Любой, кто устанавливает порог автоматического принятия 0,9 для Microsoft-Decision-1, устанавливает его на веру и корректирует его в продакшене.

A screenshot of the Kev-4B model card on Hugging Face, read 10 October 2026, showing the jaredpalmer organisation, 114 likes, an apache-2.0 licence label, and the Model card, Files and versions and Community tabs above the Kev-4B heading and a Model summary section.

Та часть сравнения, которая стоит денег

Экономика Kev — вот почему это противостояние действительно близкое. Рецепт — замороженная база плюс адаптер на 33,8 млн параметров, а значит, каждая дополнительная модель, которую вы обучаете, требует вычислений размером с адаптер, а не масштаба фундаментальной модели. Вы можете один раз держать базу в памяти и загружать несколько адаптеров — по одному на каждую область принятия решений — а это схема развёртывания, которую хостируемый API Microsoft вообще не может выразить. Если ваши правила маршрутизации отличаются от правил универсального судьи, Kev позволяет обучить это различие; Microsoft-Decision-1 позволяет написать промпт получше и надеяться.

Зато у хостингового API нет операционной поверхности. Не нужно отслеживать адаптер, не нужно поддерживать в рабочем состоянии стек обслуживания, не нужно разбираться с разрывом между валидированным и обслуживаемым контекстом и нет риска, что температура, подобранная на одном наборе данных, поведёт себя иначе на вашем. Для команды с умеренным объёмом решений сервис оказывается более дешёвым артефактом с точки зрения инженерных часов, даже если токены стоят денег; для команды, оценивающей миллионы элементов в день, самостоятельно размещённый адаптер выигрывает по удельной стоимости в тот момент, когда GPU окупается.

Есть третий путь, на котором ни одна из моделей не используется для той части, где она слабее всего, и именно на нём находится OrcaRouter. Мы не размещаем у себя Microsoft-Decision-1 или Kev — скорер, возвращающий вероятности, не является целью chat-completions, и ни одной из этих моделей нет в нашем каталоге. Генеративная половина конвейера принятия решений — это то, что мы предоставляем: модель, которая составляет черновик ответа-кандидата, пишет рубрику или выдаёт вызов инструмента, который затем оценивается. Всё это стоит за одним ключом, совместимым с OpenAI, с более чем 200 моделями на нём по прайсовой цене провайдера, передаваемой без наценки — 0%, так что изменение цены поставщиком вступает в силу на нашей стороне в тот же день. Если вы строите цикл оценки или триажа, вызов на написание можно маршрутизировать, а вызов на скоринг — нет, и именно чёткое соблюдение этой границы не даёт конвейеру скоринга незаметно превратиться в чат-конвейер.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Kev nor Microsoft-Decision-1 appears, because neither is a chat-completions target.

Как решить

Выбирайте Kev, когда вам нужны цифры до релиза, когда вы хотите дообучить модель на собственных метках решений, когда вы хотите запускать оценку внутри собственного периметра при нулевых предельных издержках или когда вы хотите, чтобы несколько областей принятия решений использовали одну резидентную базовую модель. Его опубликованные показатели ECE — это всё ещё собственные измерения автора на собственном стенде автора — считайте их правдоподобной самооценкой, а не проверенным сторонним результатом — но это по крайней мере заявленная шкала, которую вы можете попытаться воспроизвести, и рецепт тут как раз для того, чтобы их воспроизвести.

Выбирайте Microsoft-Decision-1 когда решающий фактор — закупка или длина контекста: управляемая конечная точка Azure с единым биллингом и пакетом Responsible AI, 32K входных данных для длинных документов и вендор, к которому можно обратиться за эскалацией. Отсутствие у него таблицы бенчмарков — не скандал: многие размещённые модели запускаются без неё. Но это значит, что первую кривую калибровки для этой модели нарисуют её пользователи, и вам стоит запланировать стать одним из них — на своих размеченных данных — прежде чем применять к ней продакшн-порог.