
Intern-Decision-0.8B против Gemma 4 12B: скоринговая голова против мультимодального универсала
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 592 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 187 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Самый дешёвый способ увидеть, чем является Intern-Decision-0.8B — а чем не является — это поставить его рядом с Gemma 4 12B и затем заметить, что сравнение почти полностью касается того, что каждая модель делает со своим выходным слоем. Gemma 4 12B, мультимодальная модель без энкодера от DeepMind с 11,95 млрд параметров, выпущенная 3 июня 2026 года под лицензией Apache 2.0, — это генеративный универсал: вы даёте ей текст, изображения, аудио или видео, и она пишет ответ. Intern-Decision-0.8B, тихо загруженный InternLM на Hugging Face 26 сентября 2026 года без каких-либо объявлений, — это файнтюн гораздо меньшей Qwen3.5-0.8B, который вообще не производит текст — он принимает состояние, схему именованных вопросов и до восьми изображений и возвращает калиброванное распределение вероятностей для каждого вопроса после одного прямого прохода. Один пишет. Другой оценивает. Всё нижеследующее следует из этого.
Это делает такое сопоставление странным, если представлять его как состязание, и об этом стоит прямо сказать до строк со спецификациями: эти две модели не взаимозаменяемы, и любой, кто выбирает между ними, уже неправильно сформулировал задачу. Gemma 4 12B отвечает на вопрос «каким должен быть ответ». Intern-Decision-0.8B отвечает на вопрос «какой из этих шестнадцати вариантов это и насколько вы уверены» — и отвечает на него без цикла декодера, а именно отсюда берутся различия в задержке и стоимости. Поэтому полезное сравнение состоит в том, как вы встроите каждую из них в один рабочий процесс, а не в том, какая из них победит.
Самое большое различие — это результативная сторона законопроекта.
Gemma 4 12B тарифицируется как любая генеративная модель: и входные, и выходные токены. Когда вы запрашиваете у неё структурированный JSON, каждый из этих токенов генерируется, сэмплируется и тарифицируется, и чем длиннее и более вложенная ваша схема, тем их больше. Это не критика модели — так работает декодер — но это та статья расходов, которую и призваны устранить decision heads. Intern-Decision-0.8B не имеет выходных токенов. В его карточке явно объясняется почему: путь инференса никогда не вызывает generate()/, считывая логиты в позициях непосредственно перед каждым <decision>/ плейсхолдер в предварительно отрендеренном скелете и вычисляя softmax только по разрешённым символам-кандидатам для этого поля. Счётчик использования под названием output_tokens/ считает оценённые поля, а не текст.
Последствие усиливается при масштабировании. Пайплайн, который размечает десять тысяч записей с помощью Gemma 4 12B, платит за десять тысяч JSON-документов; тот же пайплайн на Intern-Decision-0.8B платит за промпты и ничего больше. Будет ли абсолютное число большим, полностью зависит от вашего объёма и схемы, и любой, у кого есть бюджет на токены, может посчитать это в электронной таблице за десять минут. Но направление не вызывает споров, и именно поэтому категория небольших моделей принятия решений вообще появилась.
Задержка, и почему разрыв в параметрах вводит в заблуждение
• Пропускная способность модели — Intern-Decision-0.8B: один прямой проход, без цикла декодирования. Gemma 4 12B: авторегрессионная генерация, по одному токену за раз.
• Замеренная задержка — Intern-Decision-0.8B: 33,98 мс в среднем / 37,50 мс p95 на одной RTX 4090 через локальный путь Hugging Face, согласно собственному измерению InternLM. Gemma 4 12B: сопоставимого показателя для однопроходного режима не существует, потому что нет ни одного прохода, который можно было бы измерить.
• Объём — Intern-Decision-0.8B: около 1,73 ГБ хранилища репозитория, 852 985 920 параметров, распределённых по языковому шарду на 1,50 ГБ, визуальному шарду на 176 МБ и проектору на 25 МБ. Gemma 4 12B: в материалах Google к запуску указано 16 ГБ видеопамяти или унифицированной памяти.
• Детерминированность вывода — Intern-Decision-0.8B: argmax по логитам кандидатов, поэтому один и тот же вход каждый раз даёт одну и ту же метку. Gemma 4 12B: сэмплирование, если только не зафиксировать температуру на нуле, и даже тогда метка приходит в виде текста, который необходимо разобрать.
14-кратный разрыв в числе параметров между этими двумя моделями вовсе не превращается в примерно 14-кратный разрыв по времени выполнения на задаче принятия решений, потому что работа качественно иная. Intern-Decision-0.8B тратит свой единственный проход на чтение промпта — состояния, схемы, описаний вариантов — и на этом останавливается. Gemma 4 12B выполняет то же чтение промпта, а затем сверх этого добавляет каждый токен ответа. Для схемы из шестнадцати полей с описательными метками вариантов этап генерации — не погрешность округления; на него уходит большая часть реального времени. Собственная таблица InternLM невольно подтверждает это: её 2B-собрат показывает среднее 33,28 мс — чуть быстрее, чем 33,98 мс у 0.8B. Когда доминирует обработка промпта, количество параметров перестаёт быть рычагом.img src="2.png">

Где Gemma 4 12B просто находится в другой категории
Было бы нечестно оставлять спецификацию в рамках формулировки задачи принятия решения, потому что вне этих рамок Gemma 4 12B не просто впереди — она играет в другой вид спорта.
Intern-Decision-0.8B принимает текст и до восьми изображений, и это вся его входная поверхность. Его стандартный потолок входных данных — 8 192 токена; превышающий его ввод отклоняется, а не обрезается. Это намного ниже максимального позиционного эмбеддинга 262 144, заявленного в его конфиге: практическое окно ограничивает потолок, а не архитектура. Gemma 4 12B нативно принимает текст, изображения, аудио и видео благодаря безэнкодерной архитектуре, которая проецирует необработанные патчи и волновые формы напрямую в пространство эмбеддингов, поддерживает контекстное окно 256K и возвращает текст. В опубликованной карточке Google она набирает 77,2% на MMLU Pro, 77,5% на AIME 2026 без инструментов, 72,0% на LiveCodeBench v6, 78,8% на GPQA Diamond, 69,1% на MMMU Pro и 79,7% на MATH-Vision. Это данные производителя из собственной оценочной карточки Google, и, в отличие от таблицы Intern-Decision-0.8B, за ними стоит год стороннего использования, потому что Gemma 4 появилась в экосистеме — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — в первый же день.
Релизы тоже совершенно не похожи друг на друга, и этот контраст поучителен. У Gemma 4 12B в день появления были блог о запуске, технический отчёт на arXiv, страница семейства из пяти моделей, карточка оценки и ссылка для скачивания. У Intern-Decision-0.8B была карточка модели с URL GitHub, который возвращает 404, и демо-Space, который возвращает 401, и она появилась менее чем через сорок секунд после двух более крупных собратьев, которые столь же недокументированы. Один из них — продукт. Другой — чекпойнт, который кто-то решил выложить в интернет.
Оба под лицензией Apache 2.0, и это не тривиальная общая строка.
Единственное измерение, в котором эти двое по-настоящему пересекаются, — это лицензирование, и оно заслуживает отдельного абзаца, потому что именно здесь решение меняется для коммерческих пользователей. Оба распространяются под Apache 2.0. Gemma 4 12B поставляется на условиях лицензии Gemma 4, размещённых в Google, которую карточка модели определяет как Apache 2.0; Intern-Decision-0.8B несёт Apache-2.0 вместе со вторым LICENSE-QWEN/ файлом — это правильный подход для модели, производной от весов Qwen, и сигнал о том, что InternLM оформил все бумаги даже для релиза, который не анонсировал.
Это отличает обе модели от семейства LFM2.5 от Liquid AI, в котором LFM Open License v1.0 обусловливает коммерческие права тем, что ваше юридическое лицо остаётся ниже порога годовой выручки в $10 млн — реальное ограничение, которое покупателю модели для принятия решений, сравнивающему варианты, следует прочитать, прежде чем предполагать, что «открытые веса» означают одно и то же везде. Если ваш сценарий использования коммерческий и ваша выручка превышает эту черту, Apache 2.0 и лицензия LFM не взаимозаменяемы, и ни Gemma 4 12B, ни Intern-Decision-0.8B не несут этого ограничения.
Честный отчёт о цифрах Intern-Decision-0.8B
Все показатели производительности Intern-Decision-0.8B заявлены производителем и не воспроизведены. Это не формальность — это текущее состояние доказательной базы, и именно оно должно определять, какой вес имеет таблица. InternLM выбрала бенчмарки, выбрала конкурентов, провела оценки и опубликовала результаты, и при этом ни одного независимого прогона нет ни в одном публичном рейтинге. Поиск этой модели в Artificial Analysis не возвращает вообще ничего. img src="3.png">

С такой меткой форма результата всё ещё информативна. Модель 0.8B набирает 77,35 в бенчмарке Typed Decision от TypeSafe против 73,35 у Jev 1.13 — модели, в честь которой назван бенчмарк — и 94,52 в ToolACE против 91,29. В среднем по набору она получает 79,38, тогда как её собственные собратья на 2B и 4B — 84,68 и 90,02. Колонка, которая должна заставить покупателя насторожиться, — WildJailBreak, где она набирает 64,48 против 96,29 у Jev: разрыв в устойчивости к отказам такого размера является свойством файнтюна, и откуда он берётся — из базы Qwen3.5-0.8B, из цели decision-tuning или из числа параметров — нигде не задокументировано. Её профиль калибровки — более интересная интерпретация: Brier 0,530 и ожидаемая ошибка калибровки 0,066 против 0,358 и 0,095 у Jev, то есть в целом она менее точна, но заявленные ею уровни уверенности лучше согласуются с её точностью. Для рабочего процесса, основанного на порогах, это различие важнее сырой точности, и это как раз то, что у InternLM не было стимула публиковать.
В противовес этому карта оценки Gemma 4 12B тоже основана на данных вендора — Google также запускал эти бенчмарки — но она существует с июня, развёрнута во всех основных локальных средах выполнения, и любое расхождение уже всплыло бы. Доказательственный разрыв между «не воспроизведено в течение недели» и «не воспроизведено четыре месяца, и никто этого не опроверг» — вот в чём реальная разница между этими двумя колонками.
Как бы вы на самом деле их объединили
Схема, которая имеет смысл, — не вопрос выбора. Голова принятия решений обрабатывает структурированные вызовы — маршрутизацию, триаж, классификацию, оценку по рубрике, — где набор ответов закрыт, задержка имеет значение, а выходные токены — чистые накладные расходы. Универсал берёт на себя всё, что требует прозы, кода, синтеза или длинного контекста: сводку по эскалации, объяснение того, почему тикет ушёл в биллинг, черновик, который редактирует человек.
Если вы определяете, где проходит граница, самый дешёвый эксперимент — поставить обе половины за одной конечной точкой. OrcaRouter маршрутизирует более 200 моделей через единый API, совместимый с OpenAI, с автоматическим переключением при сбое и передачей цены из прайс-листа провайдера без наценки, а значит, тестирование хостируемой модели принятия решений и хостируемого универсала в одном скрипте обойдётся в один ключ и полдня. Здесь стоит уточнить одну границу: Intern-Decision-0.8B — не наша модель, это чекпоинт под лицензией Apache-2.0, который вы скачиваете и запускаете сами, и вся причина выбрать модель размером 1,73 ГБ в том, что она живёт там, где уже лежат ваши данные. Генеративная половина этого паттерна — та часть, до которой всего одна строка. Что касается конкретно Gemma 4 12B, её тоже нет в нашем каталоге; из размеров Gemma 4 мы маршрутизируем 31B и 26B A4B, а 12B — это локальная загрузка. img src="4.png">

Итак, вердикт: победителя нет. Intern-Decision-0.8B — это дешёвая, быстрая, детерминированная скоринговая голова из лаборатории, которая ещё не объяснила эту модель, с таблицей бенчмарков, которую никто не воспроизвёл, и колонкой устойчивости к отказам, которую стоит протестировать, прежде чем подпускать её к недоверенным входным данным. Gemma 4 12B — зрелая мультимодальная модель общего назначения с открытыми весами, опубликованной карточкой, техническим отчётом и в четырнадцать раз большим числом параметров, и это неподходящий инструмент для вызова классификации по шестнадцати полям — не потому, что она хуже, а потому, что генерировать ответ на вопрос, набор ответов на который вы уже выписали, — дорогой способ получить метку.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
