
Microsoft-Decision-1 против Intern-Decision-0.8B: пол-унции проблем с джейлбрейком против хостируемой пустышки
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов · 55 tok/s
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
Начните с той колонки, которую пост о запуске предпочёл бы опустить. Intern-Decision-0.8B — модель принятия решений от InternLM на 852 985 920 параметров, дообученная на базе Qwen3.5-0.8B и загруженная на Hugging Face 26 сентября 2026 года без анонса, без статьи и со ссылкой на GitHub, которая до сих пор отдаёт 404, — показывает 64,48 в WildJailBreak против эталонных 96,29 у Jev 1.13 от TypeSafe. Это не разница в округлении. Это обвал устойчивости к отказам у модели, вся задача которой — оценивать входные данные, опубликованный на собственной карточке вендора, в таблице, бенчмарк в которой принадлежит конкуренту. Поставьте рядом с этим Microsoft-Decision-1, которая стала общедоступной в Microsoft Foundry 8 октября 2026 года как текстовый оценщик, дообученный на Qwen3.5-9B, с документированной методологией оценки и ни единым результатом, напечатанным под ней, — и вы увидите настоящую картину этого противостояния. Одна из этих моделей назовёт вам число, которое выставляет её в дурном свете. Другая расскажет, какие метрики она бы использовала.
Эта инверсия стоит больше, чем спецификация. Обе модели принимают состояние и ограниченный набор вопросов и возвращают вероятности по вашим вариантам — ни одна из них не генерирует текст, и по этой оси они относятся к одному типу инструментов. Важные различия — это кто её запускает, насколько она большая, сколько вы можете проверить, и одна колонка по безопасности, которую меньшая, более тихая, полностью загружаемая модель всё же решила опубликовать.
Что каждый из них на самом деле возвращает
Microsoft-Decision-1 — это API, размещённый на хостинге, и это первое структурное отличие. Веса не распространяются — ни загрузки, ни репозитория, ни пути для дообучения, — а интеграция означает развёртывание в Foundry с подключёнными аутентификацией, биллингом и управлением Azure. Он выполняет один проход, обрабатывая до 32 768 токенов, поддерживает вопросы с ответом «да/нет», с выбором из нескольких вариантов, с оценкой, с классификацией и в формате рубрик, а также принимает только текст и выдаёт числовые значения. Он явно поддерживает возможность воздержаться от ответа, например «не могу определить», когда доказательств недостаточно, — именно это делает порог осмысленным.
Intern-Decision-0.8B — это противоположная схема. Это веса под Apache 2.0 с сохранённой рядом вышестоящей лицензией Qwen в виде LICENSE-QWEN, около 1.73 GB репозитория в трёх шардах — языковой шард на 1.50 GB, визуальный шард на 176 MB и проектор на 25 MB, — что помещается на одну потребительскую GPU или на хорошо оснащённый ноутбук. Он принимает состояние, схему из одного–шестнадцати именованных вопросов, в каждом из которых до 62 вариантов, и, опционально, до восьми изображений, а поставляемый вместе с ним inference.py документирует контракт подробнее, чем утруждает себя большинство выпущенных моделей: варианты отображаются на однотокенные символы A–Z, затем a–z, затем 0–9; логиты считываются в позиции непосредственно перед каждым плейсхолдером <decision> в предварительно отрисованном скелете; softmax берётся только по допустимым кандидатам этого поля; применяется подобранная температура.
Эти две лицензии — не одна и та же покупка. Microsoft-Decision-1 даёт вам управляемый эндпоинт и ни одного артефакта, которым вы владеете. Intern-Decision-0.8B даёт вам артефакт, которым вы владеете, без эндпоинта, без договора поддержки и без документации, кроме самого репозитория.

Потолок и калибровка, которую вы можете проверить
Два числа решают исход большинства реальных интеграций, и оба они принадлежат маленькой модели.
Первое — 8 192 токена. Движок вывода Intern-Decision-0.8B отказывается от входных данных слишком большого размера, а не усекает их, что является правильным поведением для системы оценки, а также жёсткой стеной: не существует стратегии разбиения на фрагменты, сохраняющей контракт, потому что состояние, схема и скелет должны быть в одном проходе. Потолок Microsoft-Decision-1 в четыре раза выше — 32 768, и это лимит хостинга, который можно поднять, изменив конфигурацию, а не константа в Python-файле.
Второй аспект — это калибровка, и здесь направление меняется на противоположное. InternLM публикует подобранную температуру 2.747760550703 для модели 0.8B, выбранную путём минимизации NLL на 1 728 выделенных калибровочных случаях, из которых 1 693 отложены для валидации, причём в карточке явно указано, что метки тестового набора не использовались для её выбора. Применяемое преобразование — это softmax по логитам кандидатов данного поля, за которым следует второй softmax по логарифму этого распределения, делённому на температуру. Поскольку преобразование выполняется после первого softmax и сохраняет порядок, оно вообще не может изменить argmax — оно меняет уверенность, вероятность «да» и ожидаемое значение для вопроса о балле, а метка остаётся той же. Если ваш конвейер считывает метку, температура ни на что не влияет. Если он считывает вероятность, применяет к ней порог или использует её в расчёте ожидаемого значения, температура — это разница между числом, которое что-то значит, и числом, которое не значит ничего. Передача temperature=1 возвращает некалиброванное распределение, если вы предпочитаете подобрать своё.
У Microsoft-Decision-1 нет эквивалентного артефакта. На вкладке «Benchmarks» указано, что точность, ошибка калибровки, полнота по безопасности, частоты ложноположительных срабатываний и согласованность по справедливости измерялись на публичных и общественных бенчмарках для принятия решений, а также на отложенных внутренних тестовых наборах, что порядок вариантов варьировался, что применялись парные статистические тесты и что модель «работает на уровне ведущих моделей принятия решений и опережает другие открытые модели принятия решений, оценённые по той же методологии». Не приводится ни ошибка калибровки, ни температура, которую можно было бы проверить, ни описание разбиения для валидации. Единственное свойство, которое делает вероятность полезной — означает ли 0,8 именно 0,8, — лишь утверждается, но не измеряется количественно.
Прочитайте эти два абзаца в сопоставлении друг с другом — и сравнение перестаёт сводиться к размеру. Чекпоинт с 0,8 млрд параметров, калибровку которого можно изучить, а ПО — запустить, для команды оценки представляет собой более удобный для работы объект, чем хостируемый API, калибровка которого умещается в одно предложение. У небольшой модели также есть зафиксированный показатель задержки — 33,98 мс в среднем, 33,44 мс медиана, 37,50 мс p95 на запрос на одной RTX 4090 через локальный путь Hugging Face, по собственному измерению InternLM, — тогда как у Microsoft это то, что вы измеряете в рамках собственного развёртывания, где выбор между бессерверным режимом и выделенной пропускной способностью сдвинет этот показатель сильнее, чем сама модель.

Где небольшая модель проигрывает
Ничто из вышеперечисленного не делает Intern-Decision-0.8B безопасным выбором, и та же опубликованная таблица объясняет почему. WildJailBreak на 64.48против 96.29 у Jev — это разрыв в устойчивости к отказам в тридцать пунктов именно в той категории, где оценщик сталкивается с недоверенным вводом. Модель принятия решений часто является тем компонентом, который решает, разрешено ли предложенное действие; та, которую легко обойти уговорами, — обуза на этой позиции. Связан ли этот недостаток с базой Qwen3.5-0.8B, с целью дообучения для принятия решений или с малым числом параметров — репозиторий вам этого не сообщает, и нет ни статьи, ни рецепта обучения, ни раскрытия данных, которые бы это сделали.
Остальная часть собственной таблицы InternLM выглядит более лестно, чем тот столбец, и всё же остаётся скромной. Среднее по семи наборам — 79.38 для 0.8B против 84.68 для собственного 2B-собрата и 90.02 для 4B — семейство круто поднимается с ростом размера, что слабо сигнализирует: таблицу не подгоняли задним числом, чтобы польстить флагману. AG News показывает 88.61 против 89.57 у Jev — фактически равенство в четырёхклассовой тематической классификации. По калибровке 0.8B сообщает Brier 0.530 и ожидаемую ошибку калибровки 0.066 против 0.358 и 0.095 у Jev — лучше ECE, заметно хуже точность. Это правдоподобный профиль для небольшой модели с намеренно подобранной температурой, и это не та комбинация, которую маркетинговая команда стала бы публиковать случайно.
Также нет даты релиза, нет анонса, нет коллекции, собирающей три контрольные точки, нигде нет размещённой конечной точки, и нет независимой оценки какого-либо рода. Демо Space отвечает 401. Правильное описание Intern-Decision-0.8B — это выпущенная контрольная точка с непроверенными утверждениями — что лучше ситуации с API в листе ожидания, потому что вы можете измерить её за полдня, но это означает, что бремя проверки полностью лежит на вас.
Выбор и где находится OrcaRouter
Выбирайте Microsoft-Decision-1, если препятствие — закупки или масштабирование: вам нужна аутентификация Azure, единый биллинг и оценка ответственного ИИ, прежде чем что-либо попадёт в продакшен; вам нужен контекст 32K; вам нужен эндпоинт, которым вы не управляете; или вам нужен встроенный путь отказа от ответа, а не самодельный. Примите в обмен на это, что вы не можете запускать его, не можете дообучать его, не можете проверить его калибровку и будете сами измерять его ключевое утверждение.
Выбирайте Intern-Decision-0.8B, если блокер — это стоимость, память или контроль: вам нужна скоринговая модель с лицензией Apache-2.0, которая помещается в 1,73 ГБ, работает на уже имеющемся у вас оборудовании, всегда выдаёт одну и ту же метку и может быть заменена на своего 2B- или 4B-собрата путём изменения пути к чекпоинту. Взамен примите ограничение в 8 192 токена, столбец WildJailBreak и тот факт, что никто за пределами InternLM не воспроизвёл ничего на карточке модели.
Честная рекомендация — сделать и то, и другое, потому что и то и другое достаточно дёшево, так что спорить тут почти не о чем. Сам вызов оценки — это не то, что мы маршрутизируем: модель, возвращающая вероятности вместо текста, — это не chat completion, и ни того, ни другого нет в нашем каталоге. OrcaRouter обеспечивает другую половину цикла: более 200 моделей за одним ключом, совместимым с OpenAI, которые составляют рубрику, генерируют варианты ответов или выполняют тот вызов инструмента, который ваш оценщик вот-вот должен оценить, — по прайс-листовой цене провайдера, передаваемой с наценкой 0%, так что снижение цены вендором на генератор действует на нашей стороне в тот же день. Автоматическое переключение при сбое здесь важнее обычного, потому что конвейер, который оценивает всё, что видит, не располагает запасом, чтобы повторить зависший вызов, а DSL маршрутизации позволяет отправить один промпт судьи нескольким генераторам и объединить их согласие, а не доверять одному из них.

Итог
Microsoft-Decision-1 стала общедоступной в Microsoft Foundry 8 октября 2026 года: размещена как хостинговый сервис, только текст, 32 768 токенов, создана на базе Qwen3.5-9B, вместо таблицы бенчмарков — абзац с описанием методологии. Intern-Decision-0.8B — это чекпойнт размером 1,73 ГБ под лицензией Apache-2.0, загруженный 26 сентября 2026 года, который публикует Brier 0,530, ECE 0,066, подобранную температуру 2,747760550703, 33,98 мс на 4090 — и показатель WildJailBreak 64,48, который никто не просил публиковать. Если перед внедрением любого из них вы можете проверить только одну вещь, проверьте калибровку на своих собственных размеченных случаях; именно это число оба поставщика оставили вам найти.
