
Intern-Decision-2B против Gemma 4 12B: потолок в 8 192 токена против окна в 256K
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 584 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 187 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Предположим, вам нужно оценить сорокастраничное дело о страховом возмещении. internlm/Intern-Decision-2B откажется от него. Не усечёт его, не перескажет — откажется, потому что встроенный движок вывода объявляет DecisionEngine(max_length=8192), а карточка модели прямо говорит, что слишком большие входные данные «отклоняются без усечения». google/gemma-4-12B-it — Gemma 4 12B Unified — возьмёт тот же документ, плюс прикреплённые к нему отсканированные фотографии, плюс записанный телефонный разговор, и напишет вам ответ. Этот контраст и есть всё сравнение, и он почти ничего общего не имеет с числом параметров — 2 213 241 664 против 11 959 730 224, — которые в первую очередь поставил бы тот, кто читает спецификацию.
Intern-Decision-2B — средняя из трёх контрольных точек принятия решений, которые InternLM загрузила на Hugging Face 26 сентября 2026 года без анонса; она дообучена на основе Qwen/Qwen3.5-2B и лицензирована под Apache-2.0 с сохранением условий Qwen. Gemma 4 12B Unified — это мультимодальная модель Google DeepMind без энкодера, выпущенная в мае 2026 года: система «любой-в-любой», принимающая текст, изображения, аудио и видео и генерирующая текст в окне на 256 000 токенов более чем на 140 языках. Одна из них — скорер. Другая — универсал, который, если аккуратно подобрать промпт, способен оценивать плохо. Выбор между ними — не столько вопрос бенчмарка, сколько вопрос о том, какую форму уже имеет ваш ответ.
Где эти два на самом деле несопоставимы
Об этом стоит сказать прямо, прежде чем перейти к цифрам, потому что это противостояние создаёт ложное впечатление симметрии.
Intern-Decision-2B не выдаёт токенов. Он принимает состояние, от одного до шестнадцати именованных вопросов с до 62 вариантами каждый и, опционально, до восьми изображений; формирует скелет JSON-ассистента с одним заполнителем <decision> на поле; выполняет один прямой причинный проход; считывает логиты в позиции непосредственно перед каждым заполнителем; выполняет softmax только по допустимым символам этого поля; и применяет подобранную температуру 2.100509348278. На выходе получается калиброванное распределение и argmax для каждого поля. В карточке прямо указано отрицание: «Этот API выполняет структурированное оценивание кандидатов. Он не вызывает generate() и не сэмплирует свободный текст.»
Gemma 4 12B генерирует. Всё, что она делает, — рассуждения с настраиваемым режимом мышления, вызов функций, OCR, понимание графиков, распознавание речи, поддержка 140 языков — проходит через цикл декодирования по словарю из 262 144 записей. Попросите её принять решение о маршрутизации с вероятностями, и вы получите текст, содержащий число, и это число будет тем, что выдал сэмплер, а не softmax по вашему набору вариантов.
Так что практический вопрос не в том, «что точнее». А в том, «является ли мой ответ уже закрытым множеством?» Если да, то 12B — расточительный способ выбирать из списка. Если нет, Intern-Decision-2B не поможет вам ни при какой точности вообще.
Потолок ввода — самая чёткая граница между ними.
Вот измерение, которое следует взвешивать превыше всего остального, поскольку оно приводит к полным отказам, а не к деградации.
• Длина ввода — Intern-Decision-2B принимает 8 192 токена и громко отклоняет всё, что длиннее; Gemma 4 12B принимает 256 000 токенов и, согласно собственной карточке Google, набирает 43,4% на MRCR v2 eight-needle при 128k.
• Изображения — до восьми для Intern-Decision-2B, и они учитываются в том же бюджете в 8 192 токена; переменное соотношение сторон и разрешение для Gemma 4 12B, с чередующимся вводом текста и изображений в любом порядке.
• Входные модальности — текст и изображение для одного; текст, изображение, аудио и видео для другого.
• Язык — в документации Intern-Decision нигде не делается заявление о многоязычности; Gemma 4 охватывает более 140 предварительно обученных языков с оценённым показателем многоязычности 83,4 по MMMLU для модели 12B.
• Вывод — типизированное распределение ответов в формате JSON для одного; сгенерированный текст для другого.
Ограничение в 8 192 не случайно, и именно поэтому его так трудно обойти. Целевая функция решения считывает логит в фиксированной позиции для каждого поля, поэтому промпт должен содержать состояние, схему и полный скелет за один проход; не существует стратегии разбиения на части, которая сохраняла бы этот контракт. Тикет, письмо, короткое JSON-состояние, один-два скриншота — вот что находится в центре дизайна. Документ, требующий извлечения, — это документ, для которого эта модель не предназначена.
Во что каждый из них вам обходится, если посчитать честно
Intern-Decision-2B не имеет ни хостируемой конечной точки, ни провайдера. Страница модели OrcaRouter для неё возвращает 404, и ничто в этой статье не является утверждением о доступности. Чтобы его вызвать, потребуется скачать репозиторий объёмом примерно 4,46 ГБ — языковой шард на 3,76 ГБ, визуальную башню на 612,5 МБ, проектор на 50,3 МБ — и запустить inference.py рядом с весами в среде Python 3.12 с torch 2.9.1 и transformers 5.14.1, на GPU, за который вы платите, независимо от того, оценивает ли он решения.
Это не является недостатком во всех случаях, и арифметику стоит провести, а не предполагать. При средних 33,28 мс на запрос на одной RTX 4090, по собственным измерениям InternLM, локально размещённая Intern-Decision-2B не тарифицирует ничего за решение. Хостинговая универсальная модель тарифицируется по токенам, включая токены, которые она тратит на размышления перед ответом. При больших объёмах уже имеющийся у вас скорер — более дешёвый инструмент: затраты — это GPU и инженерия, а не сам вызов.
Gemma 4 12B Unified также отсутствует в нашем каталоге; если он вам нужен, скачайте 11,96 млрд параметров в BF16 и обслуживайте его самостоятельно. А вот где в нашем каталоге действительно есть рабочие маршруты Gemma 4 — так это два других размера, и они дёшевы: Gemma 4 26B A4B — $0,06 за миллион входных токенов и $0,33 за миллион выходных, а Gemma 4 31B — $0,13 и $0,38; для обоих указан контекст 262 144 токена и P50 времени до первого токена, которое каталог показывает как 1,73 секунды. Если ваша задача окажется задачей общего рассуждения, а не решением с закрытым набором вариантов, то именно это и стоит сравнивать с локально запускаемым скорером — ещё две модели на одном ключе, цена по прайс-листу провайдера передаётся без наценки, и автоматическое переключение при сбое, чтобы модель, которую вы всё ещё оцениваете, никогда не становилась единой точкой отказа в продакшн-контуре.

Табло, с приложенными оговорками
• Параметры — Intern-Decision-2B 2 213 241 664 в BF16 плюс визуальная башня и проектор; Gemma 4 12B Unified 11 959 730 224 в BF16.
• Контекст — 8 192 токена, отклонён выше, против 256 000 токенов.
• Вывод — откалиброванные вероятности и argmax, без текста; сгенерированный текст, по одному токену за раз.
• Модальность — текст плюс до восьми изображений против ввода текста, изображения, аудио и видео и вывода текста.
• Опубликованные данные — таблица вендора по семи наборам тестов со средним значением 84,68, показателем Брайера 0,437 и ECE 0,100, не воспроизведённая никем за пределами лаборатории; оценочная карточка Google с MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 без инструментов 77,5 и LiveCodeBench v6 72,0, а также независимая запись на уровне 14,2 по Artificial Analysis Intelligence Index.
• Внедрение — один лайк и ноль загрузок у 2B-чекпоинта по сравнению с семейством, которое находится в обращении с мая и имеет сотни квантизаций, файнтюнов и производных.
Читайте строки доказательств асимметрично, потому что они именно такие. Числа Google были независимо проиндексированы и воспроизведены третьими сторонами; числа InternLM не запускал никто за пределами лаборатории, а показатель калибровки в особенности следует рассматривать как хорошо задокументированное намерение, пока он не пройдёт проверку на внешнем тестовом наборе. Честный вывод не в том, что таблица поставщика неверна. А в том, что два столбца не несут одинакового доказательного веса, и сравнение, которое выводит 84.68 рядом с 77.2, не говоря об этом, вводит своего читателя в заблуждение.

Что с этим делать
Выбирайте Intern-Decision-2B, когда решение действительно закрыто, состояние легко укладывается в восемь тысяч токенов, вам нужна вероятность, к которой можно применить порог, а не абзац, который приходится разбирать, и у вас есть железо и желание работать с чекпойнтом, который пока никто не поддерживает. Средний размер, в частности, обладает самой слабой опубликованной калибровкой из трёх, выпущенных InternLM, — ECE 0,100 против 0,066 у модели вдвое меньшего размера и 0,065 у той, что почти вдвое больше, — так что если вы выбираете внутри этого семейства, 2B — это тот, для которого стоит подгонять собственную температуру, а не тот, которому можно доверять прямо из коробки.
Выбирайте Gemma 4 12B — или, что практичнее, один из двух размеров Gemma 4, которые мы действительно маршрутизируем, — когда входные данные длиннее страницы, когда задействованы аудио, видео или язык, отличный от английского, когда ответ нужно объяснить, а не просто выбрать, или когда вы не хотите владеть стеком инференса. 12B — самая маленькая из моделей Gemma 4 с нативной поддержкой аудио; 26B A4B активирует около четырёх миллиардов параметров на токен и является самым дешёвым способом войти в это семейство.
А если на самом деле у вас проблема скоринга, к которой прилагается длинный документ, то ни один из этих инструментов не подходит: это проблема поиска, переодетая в статью-сравнение.

