Титульная карточка главного блока с надписью «Intern-Decision-0.8B vs Gemma 4 12B» и подзаголовком «Один пишет ответ, другой оценивает его», с бейджами «0,8B-голова для оценки, без выходных токенов» и «11,95B мультимодальный универсал», с логотипом OrcaRouter, наложенным в углу.
Guides & Insights

Intern-Decision-0.8B против Gemma 4 12B: скоринговая голова против мультимодального универсала

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самый дешёвый способ увидеть, чем является Intern-Decision-0.8B — а чем не является — это поставить его рядом с Gemma 4 12B и затем заметить, что сравнение почти полностью касается того, что каждая модель делает со своим выходным слоем. Gemma 4 12B, мультимодальная модель без энкодера от DeepMind с 11,95 млрд параметров, выпущенная 3 июня 2026 года под лицензией Apache 2.0, — это генеративный универсал: вы даёте ей текст, изображения, аудио или видео, и она пишет ответ. Intern-Decision-0.8B, тихо загруженный InternLM на Hugging Face 26 сентября 2026 года без каких-либо объявлений, — это файнтюн гораздо меньшей Qwen3.5-0.8B, который вообще не производит текст — он принимает состояние, схему именованных вопросов и до восьми изображений и возвращает калиброванное распределение вероятностей для каждого вопроса после одного прямого прохода. Один пишет. Другой оценивает. Всё нижеследующее следует из этого.

Это делает такое сопоставление странным, если представлять его как состязание, и об этом стоит прямо сказать до строк со спецификациями: эти две модели не взаимозаменяемы, и любой, кто выбирает между ними, уже неправильно сформулировал задачу. Gemma 4 12B отвечает на вопрос «каким должен быть ответ». Intern-Decision-0.8B отвечает на вопрос «какой из этих шестнадцати вариантов это и насколько вы уверены» — и отвечает на него без цикла декодера, а именно отсюда берутся различия в задержке и стоимости. Поэтому полезное сравнение состоит в том, как вы встроите каждую из них в один рабочий процесс, а не в том, какая из них победит.

Самое большое различие — это результативная сторона законопроекта.

Gemma 4 12B тарифицируется как любая генеративная модель: и входные, и выходные токены. Когда вы запрашиваете у неё структурированный JSON, каждый из этих токенов генерируется, сэмплируется и тарифицируется, и чем длиннее и более вложенная ваша схема, тем их больше. Это не критика модели — так работает декодер — но это та статья расходов, которую и призваны устранить decision heads. Intern-Decision-0.8B не имеет выходных токенов. В его карточке явно объясняется почему: путь инференса никогда не вызывает generate()/, считывая логиты в позициях непосредственно перед каждым <decision>/ плейсхолдер в предварительно отрендеренном скелете и вычисляя softmax только по разрешённым символам-кандидатам для этого поля. Счётчик использования под названием output_tokens/ считает оценённые поля, а не текст.

Последствие усиливается при масштабировании. Пайплайн, который размечает десять тысяч записей с помощью Gemma 4 12B, платит за десять тысяч JSON-документов; тот же пайплайн на Intern-Decision-0.8B платит за промпты и ничего больше. Будет ли абсолютное число большим, полностью зависит от вашего объёма и схемы, и любой, у кого есть бюджет на токены, может посчитать это в электронной таблице за десять минут. Но направление не вызывает споров, и именно поэтому категория небольших моделей принятия решений вообще появилась.

Задержка, и почему разрыв в параметрах вводит в заблуждение

• Пропускная способность модели — Intern-Decision-0.8B: один прямой проход, без цикла декодирования. Gemma 4 12B: авторегрессионная генерация, по одному токену за раз.

• Замеренная задержка — Intern-Decision-0.8B: 33,98 мс в среднем / 37,50 мс p95 на одной RTX 4090 через локальный путь Hugging Face, согласно собственному измерению InternLM. Gemma 4 12B: сопоставимого показателя для однопроходного режима не существует, потому что нет ни одного прохода, который можно было бы измерить.

• Объём — Intern-Decision-0.8B: около 1,73 ГБ хранилища репозитория, 852 985 920 параметров, распределённых по языковому шарду на 1,50 ГБ, визуальному шарду на 176 МБ и проектору на 25 МБ. Gemma 4 12B: в материалах Google к запуску указано 16 ГБ видеопамяти или унифицированной памяти.

• Детерминированность вывода — Intern-Decision-0.8B: argmax по логитам кандидатов, поэтому один и тот же вход каждый раз даёт одну и ту же метку. Gemma 4 12B: сэмплирование, если только не зафиксировать температуру на нуле, и даже тогда метка приходит в виде текста, который необходимо разобрать.

14-кратный разрыв в числе параметров между этими двумя моделями вовсе не превращается в примерно 14-кратный разрыв по времени выполнения на задаче принятия решений, потому что работа качественно иная. Intern-Decision-0.8B тратит свой единственный проход на чтение промпта — состояния, схемы, описаний вариантов — и на этом останавливается. Gemma 4 12B выполняет то же чтение промпта, а затем сверх этого добавляет каждый токен ответа. Для схемы из шестнадцати полей с описательными метками вариантов этап генерации — не погрешность округления; на него уходит большая часть реального времени. Собственная таблица InternLM невольно подтверждает это: её 2B-собрат показывает среднее 33,28 мс — чуть быстрее, чем 33,98 мс у 0.8B. Когда доминирует обработка промпта, количество параметров перестаёт быть рычагом.img src="2.png">

A two-column scoreboard comparing Intern-Decision-0.8B with Gemma 4 12B on six shared rows: parameters 852,985,920 against 11.95B, output tokens none because logits are read rather than generated against every token generated and billed, latency 33.98 ms mean and 37.50 ms p95 against no comparable single-pass figure, input surface text plus up to eight images under an 8,192-token ceiling against text, image, audio and video with a 256K context, published evidence a vendor table unreproduced against Google's own evaluation card, and licence Apache 2.0 plus LICENSE-QWEN against Apache 2.0 under Gemma 4 terms.

Где Gemma 4 12B просто находится в другой категории

Было бы нечестно оставлять спецификацию в рамках формулировки задачи принятия решения, потому что вне этих рамок Gemma 4 12B не просто впереди — она играет в другой вид спорта.

Intern-Decision-0.8B принимает текст и до восьми изображений, и это вся его входная поверхность. Его стандартный потолок входных данных — 8 192 токена; превышающий его ввод отклоняется, а не обрезается. Это намного ниже максимального позиционного эмбеддинга 262 144, заявленного в его конфиге: практическое окно ограничивает потолок, а не архитектура. Gemma 4 12B нативно принимает текст, изображения, аудио и видео благодаря безэнкодерной архитектуре, которая проецирует необработанные патчи и волновые формы напрямую в пространство эмбеддингов, поддерживает контекстное окно 256K и возвращает текст. В опубликованной карточке Google она набирает 77,2% на MMLU Pro, 77,5% на AIME 2026 без инструментов, 72,0% на LiveCodeBench v6, 78,8% на GPQA Diamond, 69,1% на MMMU Pro и 79,7% на MATH-Vision. Это данные производителя из собственной оценочной карточки Google, и, в отличие от таблицы Intern-Decision-0.8B, за ними стоит год стороннего использования, потому что Gemma 4 появилась в экосистеме — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — в первый же день.

Релизы тоже совершенно не похожи друг на друга, и этот контраст поучителен. У Gemma 4 12B в день появления были блог о запуске, технический отчёт на arXiv, страница семейства из пяти моделей, карточка оценки и ссылка для скачивания. У Intern-Decision-0.8B была карточка модели с URL GitHub, который возвращает 404, и демо-Space, который возвращает 401, и она появилась менее чем через сорок секунд после двух более крупных собратьев, которые столь же недокументированы. Один из них — продукт. Другой — чекпойнт, который кто-то решил выложить в интернет.

Оба под лицензией Apache 2.0, и это не тривиальная общая строка.

Единственное измерение, в котором эти двое по-настоящему пересекаются, — это лицензирование, и оно заслуживает отдельного абзаца, потому что именно здесь решение меняется для коммерческих пользователей. Оба распространяются под Apache 2.0. Gemma 4 12B поставляется на условиях лицензии Gemma 4, размещённых в Google, которую карточка модели определяет как Apache 2.0; Intern-Decision-0.8B несёт Apache-2.0 вместе со вторым LICENSE-QWEN/ файлом — это правильный подход для модели, производной от весов Qwen, и сигнал о том, что InternLM оформил все бумаги даже для релиза, который не анонсировал.

Это отличает обе модели от семейства LFM2.5 от Liquid AI, в котором LFM Open License v1.0 обусловливает коммерческие права тем, что ваше юридическое лицо остаётся ниже порога годовой выручки в $10 млн — реальное ограничение, которое покупателю модели для принятия решений, сравнивающему варианты, следует прочитать, прежде чем предполагать, что «открытые веса» означают одно и то же везде. Если ваш сценарий использования коммерческий и ваша выручка превышает эту черту, Apache 2.0 и лицензия LFM не взаимозаменяемы, и ни Gemma 4 12B, ни Intern-Decision-0.8B не несут этого ограничения.

Честный отчёт о цифрах Intern-Decision-0.8B

Все показатели производительности Intern-Decision-0.8B заявлены производителем и не воспроизведены. Это не формальность — это текущее состояние доказательной базы, и именно оно должно определять, какой вес имеет таблица. InternLM выбрала бенчмарки, выбрала конкурентов, провела оценки и опубликовала результаты, и при этом ни одного независимого прогона нет ни в одном публичном рейтинге. Поиск этой модели в Artificial Analysis не возвращает вообще ничего. img src="3.png">

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

С такой меткой форма результата всё ещё информативна. Модель 0.8B набирает 77,35 в бенчмарке Typed Decision от TypeSafe против 73,35 у Jev 1.13 — модели, в честь которой назван бенчмарк — и 94,52 в ToolACE против 91,29. В среднем по набору она получает 79,38, тогда как её собственные собратья на 2B и 4B — 84,68 и 90,02. Колонка, которая должна заставить покупателя насторожиться, — WildJailBreak, где она набирает 64,48 против 96,29 у Jev: разрыв в устойчивости к отказам такого размера является свойством файнтюна, и откуда он берётся — из базы Qwen3.5-0.8B, из цели decision-tuning или из числа параметров — нигде не задокументировано. Её профиль калибровки — более интересная интерпретация: Brier 0,530 и ожидаемая ошибка калибровки 0,066 против 0,358 и 0,095 у Jev, то есть в целом она менее точна, но заявленные ею уровни уверенности лучше согласуются с её точностью. Для рабочего процесса, основанного на порогах, это различие важнее сырой точности, и это как раз то, что у InternLM не было стимула публиковать.

В противовес этому карта оценки Gemma 4 12B тоже основана на данных вендора — Google также запускал эти бенчмарки — но она существует с июня, развёрнута во всех основных локальных средах выполнения, и любое расхождение уже всплыло бы. Доказательственный разрыв между «не воспроизведено в течение недели» и «не воспроизведено четыре месяца, и никто этого не опроверг» — вот в чём реальная разница между этими двумя колонками.

Как бы вы на самом деле их объединили

Схема, которая имеет смысл, — не вопрос выбора. Голова принятия решений обрабатывает структурированные вызовы — маршрутизацию, триаж, классификацию, оценку по рубрике, — где набор ответов закрыт, задержка имеет значение, а выходные токены — чистые накладные расходы. Универсал берёт на себя всё, что требует прозы, кода, синтеза или длинного контекста: сводку по эскалации, объяснение того, почему тикет ушёл в биллинг, черновик, который редактирует человек.

Если вы определяете, где проходит граница, самый дешёвый эксперимент — поставить обе половины за одной конечной точкой. OrcaRouter маршрутизирует более 200 моделей через единый API, совместимый с OpenAI, с автоматическим переключением при сбое и передачей цены из прайс-листа провайдера без наценки, а значит, тестирование хостируемой модели принятия решений и хостируемого универсала в одном скрипте обойдётся в один ключ и полдня. Здесь стоит уточнить одну границу: Intern-Decision-0.8B — не наша модель, это чекпоинт под лицензией Apache-2.0, который вы скачиваете и запускаете сами, и вся причина выбрать модель размером 1,73 ГБ в том, что она живёт там, где уже лежат ваши данные. Генеративная половина этого паттерна — та часть, до которой всего одна строка. Что касается конкретно Gemma 4 12B, её тоже нет в нашем каталоге; из размеров Gemma 4 мы маршрутизируем 31B и 26B A4B, а 12B — это локальная загрузка. img src="4.png">

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Итак, вердикт: победителя нет. Intern-Decision-0.8B — это дешёвая, быстрая, детерминированная скоринговая голова из лаборатории, которая ещё не объяснила эту модель, с таблицей бенчмарков, которую никто не воспроизвёл, и колонкой устойчивости к отказам, которую стоит протестировать, прежде чем подпускать её к недоверенным входным данным. Gemma 4 12B — зрелая мультимодальная модель общего назначения с открытыми весами, опубликованной карточкой, техническим отчётом и в четырнадцать раз большим числом параметров, и это неподходящий инструмент для вызова классификации по шестнадцати полям — не потому, что она хуже, а потому, что генерировать ответ на вопрос, набор ответов на который вы уже выписали, — дорогой способ получить метку.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube