
Microsoft-Decision-1 против Intern-Decision-4B: один публикует свою калибровку, другой публикует свою методологию
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
Поставьте Microsoft-Decision-1 рядом с Intern-Decision-4B — и получится сравнение, в котором всё решает не столько функциональность, сколько то, что каждый вендор был готов опубликовать. Модель Microsoft стала общедоступной в Microsoft Foundry 8 октября 2026 года: база Qwen3.5-9B, дообученная Microsoft, только текст, контекст на 32 768 токенов, веса не распространяются, методология оценки с описанием точности, ошибки калибровки и парных статистических тестов — и ни одного результата. Intern-Decision-4B от InternLM появилась на Hugging Face 26 сентября 2026 года в 05:36:37 UTC без какого-либо анонса, дообучена из Qwen3.5-4B, принимает изображения наравне с текстом, работает за 44 миллисекунды на одной RTX 4090 и выдаёт полную таблицу значений Brier и ожидаемой ошибки калибровки. Обе возвращают распределение вероятностей по заданным вами вариантам. Но только одна из них говорит, насколько хорошо она это делает.
Эта инверсия — когда более крупная и лучше финансируемая модель оказывается непрозрачной — определяет всю суть этого противостояния и для большинства команд решает выбор быстрее, чем любая строка в спецификации.
Единственное число, которое их разделяет
InternLM сообщает Brier 0,347 и ECE 0,065 для Intern-Decision-4B по всему его набору бенчмарков, со средним баллом 90,02 по Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) и WildJailBreak (89,86). Это цифры, заявленные производителем на его собственном тестовом стенде, а строки Jevbench в особенности относятся к собственному семейству бенчмарков проекта — воспринимайте их как самооценку, а не независимую проверку. Но это числа с указанной шкалой, и именно ECE — тот показатель, который говорит, стоит ли действовать на основе возвращённого значения 0,8.
Microsoft не публикует аналогов. Вкладка Benchmarks на странице каталога Microsoft-Decision-1 описывает, что было измерено, и утверждает, что модель «работает наравне с ведущими моделями принятия решений и опережает другие открытые модели принятия решений, оценённые по той же методологии», при этом сильнейшими областями названы рассуждения, применение правил и устойчивость к формату запросов, а слабейшей — специализированные знания в предметной области. Ни Brier, ни ECE, ни таблицы точности. Если для принятия решения о внедрении вам нужен калибровочный показатель, прежде чем вы сможете определить порог эскалации, одна из этих двух моделей предоставит его вам, а другая попросит вас измерить его самостоятельно.

В чём на самом деле различаются два договора
Внешне эти модели принимают один и тот же вызов. Вы передаёте состояние, схему именованных вопросов и фиксированный набор вариантов; в ответ вы получаете вероятность для каждого варианта без единого токена сгенерированного текста. Различия проявляются на границах этого контракта.
• Модальность — Microsoft-Decision-1 является строго текстовой моделью и не принимает и не создаёт изображения, аудио или видео. Intern-Decision-4B принимает необязательные изображения вместе с состоянием, до восьми за вызов, что делает его кандидатом для триажа скриншотов, проверки макета документов и маршрутизации визуального QA.
• Количество вопросов — InternLM описывает от 1 до 16 вопросов на вызов, до 62 вариантов в каждом, по трём типам полей (choice, score, noul). Microsoft описывает форматы — да/нет, множественный выбор, рейтинг, классификация, рубрика — и один вызов объёмом до 32K токенов, но не предельное число вопросов на вызов.
• Контекст — Microsoft заявляет 32 768 токенов. В карточке Intern-Decision-4B ограничения указаны в вопросах, вариантах и изображениях, а не одним числом контекста, поэтому их нельзя сопоставить по одному показателю.
• Распространение — Microsoft-Decision-1 — это хостинговый API Foundry; веса модели не распространяются, и загрузка недоступна. Intern-Decision-4B распространяется под Apache-2.0 на Hugging Face с лицензией Qwen из исходного проекта, сохраняемой в виде LICENSE-QWEN, что означает сохранение этой лицензии и уведомлений исходного проекта, если вы будете распространять его в дальнейшем.
• Структура затрат — Веса InternLM ничего не стоят при запуске и заявлены на уровне 44,16 мс в среднем и 44,60 мс по P95 на одной RTX 4090. Цена Microsoft за токен вообще не указана на странице модели.
• Управление — Microsoft поставляет оценку ответственного ИИ, документированные практики развёртывания и явные исключения (не для генерации текста, открытых вопросов-ответов, диалога, перевода или суммаризации; не должен быть единственным автоматизированным субъектом, принимающим решения в значимых решениях, касающихся людей). InternLM поставляет карточку модели, которая откровенно говорит о происхождении — веса «изменены посредством decision tuning» — и ничего похожего на пакет соответствия требованиям.

Две совершенно разные причины, по которым значения задержки трудно сравнивать
Microsoft-Decision-1 не публикует показатель задержки, так что рядом со средним значением InternLM в 44,16 мс ставить нечего. Для такой рабочей нагрузки это не мелкое упущение. Эти модели существуют, чтобы их вызывали множество раз внутри конвейера — по одному разу на каждый извлечённый документ, на каждый предложенный вызов инструмента, на каждый оцениваемый ответ, — и разница между четырьмя решениями в секунду и сорока — это разница между оценкой выборки и оценкой всего. Показатель InternLM достижим уже сегодня на оборудовании, которое можно арендовать с почасовой оплатой; показатель Microsoft приходится измерять через собственное развёртывание Foundry, и выбранная вами конфигурация развёртывания (бессерверная с оплатой по мере использования или выделенная пропускная способность) изменит его сильнее, чем сама модель.
Именно здесь становится актуальной та половина паттерна, которая относится к OrcaRouter, — и это только генеративная половина. Мы не размещаем у себя Microsoft-Decision-1 или Intern-Decision-4B: модель, возвращающая вероятности вместо текста, — это не то, куда маршрутизируют запросы chat completions, и ни одна из них не фигурирует в нашем каталоге. За нашим единственным ключом, совместимым с OpenAI, стоит пул из более чем 200 моделей, который и делает всю писательскую работу: промпт для судьи, составленный одной моделью, ответы-кандидаты, сгенерированные двумя другими, вызов инструмента, который оценивается до запуска. Цены из прайс-листа провайдера передаются с наценкой 0 %, поэтому снижение цены на генератор вступает в силу на нашей стороне в тот же день, а автоматическое переключение при сбое поддерживает работоспособность генеративной стороны цикла оценки, когда один из провайдеров начинает работать хуже, — а это здесь важнее, чем обычно, потому что конвейеру, который оценивает всё, что видит, не хватает запаса, чтобы повторить зависший вызов.

Кто что должен взять?
Выбирайте Intern-Decision-4B, если верно хотя бы одно из следующего: вам нужно оценивать как изображения, так и текст; вам нужно калибровочное число, прежде чем выпускать продукт; вы хотите иметь возможность запускать модель на собственном оборудовании в контролируемом вами контуре; или вы хотите дообучить её. Последний пункт заслуживает особого внимания — 4B-оценщик с открытыми весами и документированной обёрткой — это модель, которую можно адаптировать под собственные метки, а Microsoft-Decision-1 — это хостируемый API без возможности дообучения и без весов для адаптации.
Выбирайте Microsoft-Decision-1, если блокер — это закупка, а не производительность: вам нужны аутентификация Azure, единый биллинг, управление и оценка Responsible AI от поставщика, прежде чем что-либо попадёт в продакшен, а также нужен контекст 32K для длинных документов, работу с которыми усложняют ограничения 4B на один вызов. Отсутствие опубликованных бенчмарков — реальная цена, но эту цену можно закрыть за один день, прогнав собственный размеченный набор через обе модели и сравнив ECE, — что вы в любом случае сделали бы, прежде чем доверять таблице любого из поставщиков.
Неудобный ответ заключается в том, что оба варианта достаточно дешевы для тестирования, так что спорить почти не о чем. Intern-Decision-4B требует GPU, который у вас, вероятно, уже есть. Microsoft-Decision-1 требует развертывания в Foundry и выборки ваших собственных размеченных решений. Прогоните свои данные через оба, вычислите калибровку на подмножестве, которое важно для вас, и пусть решают числа — что, как и подобает, как раз и есть то, для чего эти модели предназначены.
