
Decision 3.0 против Intern-Decision-4B: две команды дообучили одну и ту же модель и разошлись во всём остальном
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов · 71 tok/s
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
Поставьте d3-mini, 4B-версию Decision 3.0, рядом с Intern-Decision-4B — и первое, что вы заметите, — вовсе не разница. Оба — файнтюны одного и того же базового чекпоинта, Qwen3.5-4B. У обеих заявлено 4,54 миллиарда параметров. Оба принимают состояние, схему именованных вопросов и набор ответов-кандидатов и возвращают калиброванную вероятность для каждого кандидата, не генерируя ни одного токена. Оба распространяются под лицензией Apache-2.0. Оба были выпущены без анонса — InternLM загрузила три чекпоинта за сорок секунд 26 сентября 2026 года, а семейство Decision 3.0 от vLLM-SR появилось на Hugging Face 10 октября 2026 года, причём новость об этом разнёс только X-аккаунт проекта vLLM.
Всё, что идёт после этого, — разногласия. Они расходятся во мнениях о том, как извлекать вероятность из модели, считается ли видео входными данными, какой длины может быть запрос и — особенно остро — готов ли коллектив публиковать число, которое говорит, что его собственная уверенность заслуживает доверия. Эта статья о тех четырёх разногласиях и о том, чего каждое из них вам стоит, а не о том, какая модель «лучше», потому что эти две измеряются не по одной шкале и их нельзя упорядочить друг относительно друга, не проделав работу, которую не проделал ни один из поставщиков.
Совпадение, которое стоит понять в первую очередь
То, что две лаборатории выбрали один и тот же 4B-бэкбон за две недели, не так уж удивительно — Qwen3.5-4B является разумной основой для модели со структурированным выводом, и обе команды явно обратились к ней, потому что она достаточно мала для дешёвого запуска и достаточно сильна, чтобы понимать инструкции. Удивительно то, что они получили одинаковое количество параметров с точностью до четырёх значащих цифр. Это говорит о том, что тонкая настройка сохранила архитектуру, и что ни одна из них не добавила отдельную визуальную башню, достаточно большую, чтобы изменить общее число. Обе встраивают свои мультимодальные возможности в одни и те же веса.
Интересная часть — это считывание. Обе модели в принципе отвечают на вопросы одинаково — оценивают ответы-кандидаты, а не генерируют их, — и при этом совершенно по-разному с точки зрения механизма:
• Intern-Decision-4B — сопоставляет каждый вариант с одним символом токена (A–Z, затем a–z, затем 0–9), встраивает JSON-скелет в промпт с плейсхолдером для каждого поля и выполняет один причинный прямой проход, считывая логиты в позиции непосредственно перед каждым плейсхолдером. Механизм пошагово описан на карточке модели, включая точные шаги softmax и temperature.
• d3-mini — поставляется с кастомной архитектурой в modeling_d3.py с отдельной головой считывания в собственном readout.safetensors, а также decision_config.json, объявляющим noncausal_full_attention и пулинг по последнему токену, и сопоставлением токенов кодам, заданным в конфиге, а не описанным словами.
Ни один из подходов не является очевидно лучшим. У подхода InternLM есть преимущество: он работает на стандартном классе модели Hugging Face с документированной числовой последовательностью — можно проверить его работу. У подхода vLLM-SR есть преимущество: считывание — это обученная голова, а не проекция существующего эмбеддинга токена, что даёт более свободную подгонку, а плата за это — необходимость указать trust_remote_code=True и запустить их код, чтобы вообще что-либо сделать.
Пределы, которые публикует каждый из них
Именно здесь начинает формироваться настоящий выбор, потому что одна карта гораздо конкретнее другой указывает, где она перестаёт работать.
• Потолок входных данных — Intern-Decision-4B: по умолчанию 8 192 токена, а запросы, превышающие это, отклоняются сразу и никогда не усекаются; потолок задаётся аргументом конструктора. d3-mini: max_length равно null в поставляемой конфигурации, и нигде на карточке не указан бюджет токенов.
• Вопросов на запрос — Intern-Decision-4B: от 1 до 16, при заявленном максимуме в 62 варианта в одном вопросе. d3-mini: без заявленного ограничения; в карточке сказано лишь, что вопросы обрабатываются вместе, каждый — посредством собственного прямого прохода.
• Изображения — Intern-Decision-4B: до восьми на запрос, упорядоченных по предоставляемому вами списку, при этом процессор контрольных точек выполняет изменение размера и расширение токенов. d3-mini: несколько на запрос в виде путей, URL-адресов, изображений PIL или URL-адресов данных base64, каждое считывается с разрешением до 1,6 мегапикселя, каждый вопрос видит каждое изображение.
• Видео — Intern-Decision-4B: нет. d3-mini: несколько видео, считываемых со скоростью 2 кадра в секунду, с ограничением в 32 кадра, распределённых по клипу, и 0,2 мегапикселя на кадр.
Потолок входных данных — это та граница, которая решит вопрос для большинства. Бюджет в 8 192 токена, разделяемый между состоянием, инструкциями к вопросу и описаниями кандидатов, — это реальное ограничение для оценки документов и маршрутизации длинного контекста, то есть для работы, ради которой эти модели и продаются, и InternLM заслуживает признательности за то, что говорит об этом прямо, а не оставляет это на выяснение пользователям. Умалчивание vLLM-SR об этом — обратная ситуация: не скрытое ограничение, а неизвестное, и никакое чтение репозитория не позволяет это установить.
Калибровка — это настоящее разделение
Каждая модель принятия решений даёт одно и то же обещание: число, которое она возвращает, — это вероятность, и пороги, установленные относительно него, что-то да значат. Почти ни одна из них этого не доказывает. Именно здесь два релиза расходятся сильнее всего, причём расхождение идёт в противоположную сторону от той, которую можно было бы предположить по датам релиза.
Intern-Decision-4B публикует на своей карточке оценку Brier 0,347 и ожидаемую ошибку калибровки 0,065 в среднем по семи бенчмаркам, подобранную температуру 1,99241824, полученную минимизацией NLL (отрицательного логарифмического правдоподобия) на 1 728 выделенных случаях калибровки и 1 693 отдельных случаях валидации, явное утверждение о том, что метки тестового набора не использовались для выбора этой температуры, и диагностику на 96 случаях, показывающую изменение её калибровки с 0,628 Brier / 0,213 ECE перед температурным масштабированием на 0,550 / 0,089 после него. Там также указано значение по умолчанию и сказано, что калибровка выполняется для каждого чекпоинта, поэтому использование другого размера с этим модулем не даст совпадения.
Decision 3.0 публикует индекс точности и заявление о покрытии — на каждый из 140 178 публичных запросов дан ответ, ни один не остался без обоснования — и вообще ни одного показателя калибровки. Ни показателя Брайера, ни ECE, ни указанной температуры — ни на одной из шести контрольных точек. Температура в поставляемом с d3 decision_config.json равна 1.0, что является тождественным преобразованием и может быть, а может и не быть подобранным значением; в файле это не указано.
Прочитайте два заголовка индексов рядом — и асимметрия только усиливается. Карточка d3-mini сообщает о результате 54,90 по public-suite в Jev Decision Index 0.3, который описан как измеренный с помощью официального набора на опубликованных весах, тогда как строки сравнения на той же доске описываются как данные с живой доски. Intern-Decision-4B сообщает о среднем значении 90,02 по своим семи бенчмаркам. Эти два числа находятся в разных шкалах, они не используют одни и те же задачи, и помещать их в одно предложение как сравнение было бы нечестно. Сопоставимо же раскрытие информации: одна карточка сообщает, насколько ошибочны её оценки уверенности, а другая либо не знает, либо не говорит.

Задержка, и почему два набора миллисекунд тоже не поддаются сравнению
Обе карточки публикуют данные о задержке на один запрос, и принимать их за чистую монету было бы ошибкой по той же причине, по которой показатели точности несопоставимы.
• Intern-Decision-4B — среднее 44,16 мс, медиана 44,03 мс, p95 44,60 мс, измерено на одной RTX 4090 через локальный путь Hugging Face; описывается как зависящее от рабочей нагрузки и аппаратного обеспечения.
• d3-mini — медиана 17,5 мс для текста, 96,2 мс с изображением, 371,5 мс с десятисекундным видео, на одном AMD Instinct MI325X, по одному запросу за раз.
Несопоставимыми эти результаты делают два обстоятельства. Первое — это аппаратное обеспечение и программный путь: 4090 против MI325X, стандартный прямой проход Hugging Face против пользовательской реализации attention с ядрами для маскированных слоёв, доступными через flash-linear-attention. Второе — это рабочая нагрузка: показатель InternLM описывается как сквозное время на один запрос на неуказанной смеси, а показатель vLLM-SR разбит по модальностям входных данных, так что сравнение только по тексту — единственная строка, где условия одинаковы, и даже она охватывает двух производителей GPU.
Цифра, которую стоит вынести из обеих карточек, — это не рейтинг, а форма. Модель принятия решений вызывается многократно внутри одного рабочего процесса: одной записи обращения в поддержку могут понадобиться назначение, проверка возврата средств, решение об эскалации и оценка приоритета — четыре вопроса, — а пакет из 128 записей превращает это в 512 решений. При таком объёме и 17 мс, и 44 мс просто исчезают на фоне того, во сколько обходится генеративная модель дальше по цепочке. Именно на показатели по модальностям стоит обращать внимание, потому что запрос с изображением или видео, по собственным цифрам d3-mini, стоит в пять–двадцать раз дороже текстового, и если ваше решение принимается на основе скриншота, вы привнесли профиль затрат, которого нет у большинства развёртываний моделей принятия решений.
Что же всё-таки выбрать?
Если решение, которое вам нужно принять, зависит от видео, то тут не о чем спорить и не требуется никакого анализа: Decision 3.0 умеет читать видео, а Intern-Decision-4B — нет. Это исчерпывающий ответ для всего, что связано с записями экрана, клипами с камеры или последовательностями кадров, и именно этот разрыв в возможностях сам по себе оправдывает существование нового семейства.
Если ваши входные данные — это текст и изредка изображения, то выбор зависит от двух вещей, и ни одна из них не является таблицей лидеров.
Выбирайте Intern-Decision-4B, когда нужно рассуждать о порогах. Это единственная из двух, которая сообщает, означает ли 0,9 девять раз из десяти, указывает свою температуру, говорит, на каких случаях эта температура подбиралась, и документирует свой инференс как короткую нумерованную процедуру, которую можно воспроизвести на стандартном классе модели. Для скорера, стоящего перед автоматизированным действием, это именно то свойство, которое имеет значение, и оно встречается реже, чем баллы точности.
Выбирайте Decision 3.0, когда вам нужен диапазон или модальности. Шесть контрольных точек от 0,59B до 26,09B означают, что один и тот же формат запроса может обслуживаться edge-моделью с 6,7 мс и моделью на 27B, и семейство использует один интерфейс, поэтому переход между уровнями — это изменение конфигурации, а не переписывание. Подвох в том, что вы доверяете незаявленному бюджету входных данных и непроверенному заявлению о калибровке, а самая крупная модель в семействе — это та, чей индексный номер производитель измерил на собственном стенде.
Ни один из них сегодня не является безопасным выбором по умолчанию. Самый скачиваемый чекпойнт d3 появился на Hugging Face около суток назад; Intern-Decision-4B доступен уже две недели и собрал примерно 3 200 загрузок и 83 лайка — это внимание, но не продакшн-трафик. Оба достаточно дешевы, чтобы их протестировать, и ни за одним из них нет сторонней оценки. Если вы ставите скоринговую модель перед чем-то, что тратит деньги, правильный шаг — прогнать оба на ваших собственных размеченных примерах и сравнить кривые калибровки, а не строки индекса.

Где роутер действительно уместен, честно говоря
OrcaRouter не поддерживает ни одну из этих моделей. Чекпоинты Decision 3.0 — это локальный путь инференса на Python в репозитории Hugging без опубликованного HTTP-эндпоинта, а Intern-Decision-4B поставляется в виде DecisionEngine класса, который вы создаёте сами. Ни одну из них мы не можем маршрутизировать сегодня, и ни одну часть этой статьи не следует воспринимать как заявление о доступности.
Что мы действительно предоставляем — это хостинговую часть того же семейства. typesafe/jev-1.13 есть в нашем каталоге, доступна через POST /v1/systemone — тот же контракт состояния и именованных вопросов, который реализуют обе открытые модели выше — по цене $0,042 за миллион входных токенов, без платы за генерацию ответа, поскольку она его никогда не создаёт. Она соседствует с более чем 200 другими моделями, и в этом практический смысл для тех, кто сравнивает эти две: оценщик — дешёвая часть цикла, а модель, действующая по решению, — дорогая часть. Маршрутизация обеих через один ключ, с автоматическим переключением при сбоях провайдера и передачей прайсовой цены провайдера без наценки (0%), означает, что оценка модели принятия решений не требует подписания второго контракта или переписывания места вызова при смене бэкенда. Если вы в процессе оценки — а именно там обе эти модели находятся сегодня, — именно это стоит настроить, прежде чем остановиться на любой из них.

Открытый вопрос
Две карточки расходятся во мнениях о том, что автор модели должен читателю, и это расхождение интереснее самих моделей. InternLM опубликовал температуру и случаи, на которых она подбиралась, а затем опубликовал диагностику, показывающую, насколько улучшилась калибровка. vLLM-SR опубликовал хеши файлов, зафиксированные базовые ревизии, заявленную целевую аппаратную конфигурацию, заявление о покрытии — настоящую работу по провенансу — и вообще ни одного числа калибровки.
Проверка того, какой релиз становится зрелым, — это не то, какой из них побеждает в таблице лидеров. Она состоит в том, выйдет ли следующий чекпойнт Decision с оценкой Бриера для него, и дойдёт ли следующая загрузка InternLM до видео. И то, и другое видно извне, и то, и другое дёшево проверить, и ни то, ни другое пока не произошло.
