Сгенерированная титульная карточка с надписью «Intern-Decision-2B vs Gemma 4 12B», с подзаголовком «8,192 токена против 256,000», со значками «скоринг, который отказывается» и «генералист, который пишет», с логотипом OrcaRouter, наложенным в углу.
Guides & Insights

Intern-Decision-2B против Gemma 4 12B: потолок в 8 192 токена против окна в 256K

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Предположим, вам нужно оценить сорокастраничное дело о страховом возмещении. internlm/Intern-Decision-2B откажется от него. Не усечёт его, не перескажет — откажется, потому что встроенный движок вывода объявляет DecisionEngine(max_length=8192), а карточка модели прямо говорит, что слишком большие входные данные «отклоняются без усечения». google/gemma-4-12B-it — Gemma 4 12B Unified — возьмёт тот же документ, плюс прикреплённые к нему отсканированные фотографии, плюс записанный телефонный разговор, и напишет вам ответ. Этот контраст и есть всё сравнение, и он почти ничего общего не имеет с числом параметров — 2 213 241 664 против 11 959 730 224, — которые в первую очередь поставил бы тот, кто читает спецификацию.

Intern-Decision-2B — средняя из трёх контрольных точек принятия решений, которые InternLM загрузила на Hugging Face 26 сентября 2026 года без анонса; она дообучена на основе Qwen/Qwen3.5-2B и лицензирована под Apache-2.0 с сохранением условий Qwen. Gemma 4 12B Unified — это мультимодальная модель Google DeepMind без энкодера, выпущенная в мае 2026 года: система «любой-в-любой», принимающая текст, изображения, аудио и видео и генерирующая текст в окне на 256 000 токенов более чем на 140 языках. Одна из них — скорер. Другая — универсал, который, если аккуратно подобрать промпт, способен оценивать плохо. Выбор между ними — не столько вопрос бенчмарка, сколько вопрос о том, какую форму уже имеет ваш ответ.

Где эти два на самом деле несопоставимы

Об этом стоит сказать прямо, прежде чем перейти к цифрам, потому что это противостояние создаёт ложное впечатление симметрии.

Intern-Decision-2B не выдаёт токенов. Он принимает состояние, от одного до шестнадцати именованных вопросов с до 62 вариантами каждый и, опционально, до восьми изображений; формирует скелет JSON-ассистента с одним заполнителем <decision> на поле; выполняет один прямой причинный проход; считывает логиты в позиции непосредственно перед каждым заполнителем; выполняет softmax только по допустимым символам этого поля; и применяет подобранную температуру 2.100509348278. На выходе получается калиброванное распределение и argmax для каждого поля. В карточке прямо указано отрицание: «Этот API выполняет структурированное оценивание кандидатов. Он не вызывает generate() и не сэмплирует свободный текст.»

Gemma 4 12B генерирует. Всё, что она делает, — рассуждения с настраиваемым режимом мышления, вызов функций, OCR, понимание графиков, распознавание речи, поддержка 140 языков — проходит через цикл декодирования по словарю из 262 144 записей. Попросите её принять решение о маршрутизации с вероятностями, и вы получите текст, содержащий число, и это число будет тем, что выдал сэмплер, а не softmax по вашему набору вариантов.

Так что практический вопрос не в том, «что точнее». А в том, «является ли мой ответ уже закрытым множеством?» Если да, то 12B — расточительный способ выбирать из списка. Если нет, Intern-Decision-2B не поможет вам ни при какой точности вообще.

Потолок ввода — самая чёткая граница между ними.

Вот измерение, которое следует взвешивать превыше всего остального, поскольку оно приводит к полным отказам, а не к деградации.

• Длина ввода — Intern-Decision-2B принимает 8 192 токена и громко отклоняет всё, что длиннее; Gemma 4 12B принимает 256 000 токенов и, согласно собственной карточке Google, набирает 43,4% на MRCR v2 eight-needle при 128k.

• Изображения — до восьми для Intern-Decision-2B, и они учитываются в том же бюджете в 8 192 токена; переменное соотношение сторон и разрешение для Gemma 4 12B, с чередующимся вводом текста и изображений в любом порядке.

• Входные модальности — текст и изображение для одного; текст, изображение, аудио и видео для другого.

• Язык — в документации Intern-Decision нигде не делается заявление о многоязычности; Gemma 4 охватывает более 140 предварительно обученных языков с оценённым показателем многоязычности 83,4 по MMMLU для модели 12B.

• Вывод — типизированное распределение ответов в формате JSON для одного; сгенерированный текст для другого.

Ограничение в 8 192 не случайно, и именно поэтому его так трудно обойти. Целевая функция решения считывает логит в фиксированной позиции для каждого поля, поэтому промпт должен содержать состояние, схему и полный скелет за один проход; не существует стратегии разбиения на части, которая сохраняла бы этот контракт. Тикет, письмо, короткое JSON-состояние, один-два скриншота — вот что находится в центре дизайна. Документ, требующий извлечения, — это документ, для которого эта модель не предназначена.

Во что каждый из них вам обходится, если посчитать честно

Intern-Decision-2B не имеет ни хостируемой конечной точки, ни провайдера. Страница модели OrcaRouter для неё возвращает 404, и ничто в этой статье не является утверждением о доступности. Чтобы его вызвать, потребуется скачать репозиторий объёмом примерно 4,46 ГБ — языковой шард на 3,76 ГБ, визуальную башню на 612,5 МБ, проектор на 50,3 МБ — и запустить inference.py рядом с весами в среде Python 3.12 с torch 2.9.1 и transformers 5.14.1, на GPU, за который вы платите, независимо от того, оценивает ли он решения.

Это не является недостатком во всех случаях, и арифметику стоит провести, а не предполагать. При средних 33,28 мс на запрос на одной RTX 4090, по собственным измерениям InternLM, локально размещённая Intern-Decision-2B не тарифицирует ничего за решение. Хостинговая универсальная модель тарифицируется по токенам, включая токены, которые она тратит на размышления перед ответом. При больших объёмах уже имеющийся у вас скорер — более дешёвый инструмент: затраты — это GPU и инженерия, а не сам вызов.

Gemma 4 12B Unified также отсутствует в нашем каталоге; если он вам нужен, скачайте 11,96 млрд параметров в BF16 и обслуживайте его самостоятельно. А вот где в нашем каталоге действительно есть рабочие маршруты Gemma 4 — так это два других размера, и они дёшевы: Gemma 4 26B A4B — $0,06 за миллион входных токенов и $0,33 за миллион выходных, а Gemma 4 31B — $0,13 и $0,38; для обоих указан контекст 262 144 токена и P50 времени до первого токена, которое каталог показывает как 1,73 секунды. Если ваша задача окажется задачей общего рассуждения, а не решением с закрытым набором вариантов, то именно это и стоит сравнивать с локально запускаемым скорером — ещё две модели на одном ключе, цена по прайс-листу провайдера передаётся без наценки, и автоматическое переключение при сбое, чтобы модель, которую вы всё ещё оцениваете, никогда не становилась единой точкой отказа в продакшн-контуре.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

Табло, с приложенными оговорками

• Параметры — Intern-Decision-2B 2 213 241 664 в BF16 плюс визуальная башня и проектор; Gemma 4 12B Unified 11 959 730 224 в BF16.

• Контекст — 8 192 токена, отклонён выше, против 256 000 токенов.

• Вывод — откалиброванные вероятности и argmax, без текста; сгенерированный текст, по одному токену за раз.

• Модальность — текст плюс до восьми изображений против ввода текста, изображения, аудио и видео и вывода текста.

• Опубликованные данные — таблица вендора по семи наборам тестов со средним значением 84,68, показателем Брайера 0,437 и ECE 0,100, не воспроизведённая никем за пределами лаборатории; оценочная карточка Google с MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 без инструментов 77,5 и LiveCodeBench v6 72,0, а также независимая запись на уровне 14,2 по Artificial Analysis Intelligence Index.

• Внедрение — один лайк и ноль загрузок у 2B-чекпоинта по сравнению с семейством, которое находится в обращении с мая и имеет сотни квантизаций, файнтюнов и производных.

Читайте строки доказательств асимметрично, потому что они именно такие. Числа Google были независимо проиндексированы и воспроизведены третьими сторонами; числа InternLM не запускал никто за пределами лаборатории, а показатель калибровки в особенности следует рассматривать как хорошо задокументированное намерение, пока он не пройдёт проверку на внешнем тестовом наборе. Честный вывод не в том, что таблица поставщика неверна. А в том, что два столбца не несут одинакового доказательного веса, и сравнение, которое выводит 84.68 рядом с 77.2, не говоря об этом, вводит своего читателя в заблуждение.

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

Что с этим делать

Выбирайте Intern-Decision-2B, когда решение действительно закрыто, состояние легко укладывается в восемь тысяч токенов, вам нужна вероятность, к которой можно применить порог, а не абзац, который приходится разбирать, и у вас есть железо и желание работать с чекпойнтом, который пока никто не поддерживает. Средний размер, в частности, обладает самой слабой опубликованной калибровкой из трёх, выпущенных InternLM, — ECE 0,100 против 0,066 у модели вдвое меньшего размера и 0,065 у той, что почти вдвое больше, — так что если вы выбираете внутри этого семейства, 2B — это тот, для которого стоит подгонять собственную температуру, а не тот, которому можно доверять прямо из коробки.

Выбирайте Gemma 4 12B — или, что практичнее, один из двух размеров Gemma 4, которые мы действительно маршрутизируем, — когда входные данные длиннее страницы, когда задействованы аудио, видео или язык, отличный от английского, когда ответ нужно объяснить, а не просто выбрать, или когда вы не хотите владеть стеком инференса. 12B — самая маленькая из моделей Gemma 4 с нативной поддержкой аудио; 26B A4B активирует около четырёх миллиардов параметров на токен и является самым дешёвым способом войти в это семейство.

А если на самом деле у вас проблема скоринга, к которой прилагается длинный документ, то ни один из этих инструментов не подходит: это проблема поиска, переодетая в статью-сравнение.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.
© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube