Сгенерированная титульная карточка для Microsoft-Decision-1 против Gemma 4 12B с подзаголовком «оценщик без выходных токенов против писателя без закрытого набора», с чипами с надписями «вероятности против прозы», «контекст 32 768 токенов против 256 000», «только текст против текста, изображений, аудио и видео» и «хостируемый API против открытых весов».
Guides & Insights

Microsoft-Decision-1 vs Gemma 4 12B: один выбирает из вашего списка, другой пишет вам новый

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Поставьте Microsoft-Decision-1 и Gemma 4 12B рядом, и разница, которая определяет всё, — это не размер, точность или лицензия, а то, что происходит после того, как модель прочитала ваш ввод. Gemma 4 12B — мультимодальная модель DeepMind без энкодера на 11,96 млрд параметров, выпущенная 3 июня 2026 года под лицензией Apache 2.0, — читает текст, изображения, аудио или видео, а затем пишет вам ответ токен за токеном в окне на 256 000 токенов и на более чем 140. Microsoft-Decision-1 стала общедоступной в Microsoft Foundry 8 октября 2026 года в качестве чисто текстового скорера, дообученного на Qwen3.5-9B: вы передаёте ей состояние и вопрос, ответы на который вы уже перечислили, и она возвращает калиброванную вероятность для каждого варианта за один проход по последовательности длиной до 32 768 токенов, не генерируя ничего. Одна модель говорит вам, какой из ваших вариантов правильный. Другая говорит вам, какими варианты должны были быть, — и выставляет вам счёт за каждое слово этого.

Рассматривать это как состязание было бы категориальной ошибкой, и об этом стоит сказать до строк спецификации, а не после них. Эти двое не взаимозаменяемы; они находятся на противоположных концах рабочего процесса. Полезный вопрос — какой конец вы на самом деле строите, потому что ответ определяет, покупаете ли вы судью или писателя.

Законопроект — это то место, где разница перестаёт быть философской

Gemma 4 12B тарифицируется так же, как и любая генеративная модель: и входные токены, и выходные токены. Когда вы просите у неё структурированный JSON, каждый символ этого JSON генерируется, сэмплируется и оплачивается — и чем глубже вложенность вашей схемы, тем длиннее ответ и тем больше эта статья расходов. Это не дефект модели. Так работает декодер, и это ровно та статья расходов, для удаления которой и существуют головы принятия решений.

У Microsoft-Decision-1 нет выходной стороны, которую нужно оплачивать. Он выполняет один прямой проход по вашему состоянию, вашему вопросу и вашему набору вариантов, считывает оценку для каждого кандидата и возвращает результат. Последствие накапливается с объёмом, а не с размером промпта: конвейер, который размечает десять тысяч записей с помощью Gemma 4 12B, создаёт десять тысяч JSON-документов, а тот же конвейер на оценщике решений создаёт десять тысяч промптов и ничего больше. Насколько велика абсолютная экономия, полностью зависит от вашего объёма и толщины вашей схемы, и любой, у кого есть бюджет на токен, может уладить это в электронной таблице. С направлением не спорят.

Есть вторая, меньшая асимметрия: Microsoft не публикует тариф на странице модели Microsoft-Decision-1. Цены выводятся по ссылке на собственную ценовую страницу Microsoft, так что стоимость одного решения приходится смотреть в Azure, а не на карточке. Что страница всё же устанавливает — это то, что 0% вызова составляют выходные токены и что пакетный вывод отключён: нельзя амортизировать массовый прогон скоринга через пакетный канал так, как это можно было бы с генеративной моделью.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

Один и тот же ввод, два разных ответа.

Дайте обеим моделям модель и вопрос. Microsoft-Dec-1 возвращает что-то вроде 0.83 для «биллинг», 0.11 для «технический», 0.04 для «отмена», 0.02 для «не могу определить». У вас есть именуемая метка, число, по которому можно задать порог, и путь отказа от ответа — документы подтверждают, что опция в стиле «не могу определить» поддерживается, когда предоставленных данных недостаточно, и именно это делает эскалацию работоспособной. Чего вы не получаете — так это причины.

Дайте тикет Gemma 4 12B — и получите абзац. Она умеет рассуждать о запросе с настраиваемым режимом мышления, вызывать функции, читать отсканированный счёт, прикреплённый к тикету, расшифровывать голосовое сообщение, прикреплённое к нему, и отвечать на языке самого клиента. Всё это — то, чего Decision-1 не может делать ни с какой точностью: его входная поверхность — это текст и ничего больше, и он явно не предназначен для ответов на открытые вопросы, разговора, перевода или суммирования.

Ни один вывод Gemma 4 12B не является вероятностью. Попросите её принять решение о маршрутизации с оценкой уверенности — и вы получите текст, содержащий число, и это число будет тем, что выдал сэмплер, а не результатом softmax по предоставленному вами набору вариантов. Если порог в нижестоящем компоненте зависит от того, что это число что-то означает, у вас на руках проект по калибровке, а не скорер.

Всё решение сводится к тому, имеет ли ваш вопрос замкнутое множество.

Это тест, который нужно применить прежде всего остального, и он занимает около десяти минут с белой доской.

• Если ваш ответ берётся из списка, который вы можете перечислить заранее — метка, рейтинг, да/нет, балл по рубрике, маршрут — Microsoft-Decision- и есть правильный инструмент, а Gemma 4 12B — это расточительный и менее надёжный способ выбрать из этого списка. Вы бы платили декодеру за то, чтобы он угадывал число, которое вы уже ограничили.

• Если ваш ответ не является закрытым множеством — обобщите это, объясните то, напишите ответ, опишите диаграмму — Microsoft-Decision-1 не может помочь ни за какую цену. У него нет пути к прозе, нет поля обоснования и нет механизма для создания чего-либо, что вы не перечислили как вариант.

• Если верно и то и другое, у вас не выбор, а конвейер из двух моделей, и интересный вопрос проектирования становится таким: какая из них владеет порогом эскалации. Его задаёт оценщик; писатель определяет, что происходит выше и ниже этого порога.

Где Gemma 4 12B — это просто другой вид спорта

За пределами рамок принятия решений Gemma 4 12B не впереди по линейке — она играет в другую игру, и делать вид, что это не так, было бы нечестно.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• Модальности — Microsoft-Decision-1 принимает только текст, а выдаёт числа. Gemma 4 12B нативно работает с текстом, изображениями, аудио и видео благодаря архитектуре без энкодера, которая проецирует необработанные патчи и сигналы waveform напрямую в пространство эмбеддингов, обеспечивая чередующийся ввод в любом порядке.

• Контекст — 32 768 токенов для Microsoft-Decision-1 против 256 000 для Gemma 4 12B, которая набирает 43,4% на MRCR v2 eight-needle при 128k в собственной карточке Google.

• Язык — 25 поддерживаемых языков для Microsoft-Decision-1, при этом Microsoft предупреждает, что охват, качество и калибровка «могут варьироваться в зависимости от языка», и называет языки с ограниченными ресурсами, кроме английского, слабым местом; 140+ для Gemma 4 12B с оценённым показателем MMMLU 83,4 для этого размера.

• Опубликованная производительность — вкладка Benchmarks Microsoft-Decision-1 содержит методологию, но не содержит числовых значений; Google публикует для Gemma 4 12B 77,2% MMLU Pro, 77,5% AIME 2026 без инструментов, 72,0% LiveCodeBench v6, 78,8% GPQA Diamond, 69,1% MMMU Pro и 79,7% MATH-Vision.

• Распространение — Microsoft-Decision-1 — это API с хостингом исключительно в Foundry, без весов, без загрузки и без возможности дообучения. Gemma 4 12B — это веса под Apache 2.0, которые с первого дня вошли в экосистему LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang и Unsloth.

• Среда выполнения — оценка решений выполняется за один проход, без цикла декодирования, поэтому задержка масштабируется с длиной промпта, а не с длиной ответа; Gemma 4 12B генерирует токен за токеном, а в материалах запуска Google указано, что для неё требуется 16 ГБ видеопамяти или унифицированной памяти.

Строка с результатами бенчмарка — как раз та, на которой стоит задержаться, причём в самом нелестном для Microsoft свете. Цифры Gemma 4 12B тоже заявлены производителем, но за ними стоят месяцы использования третьими сторонами — в публичных тестовых стендах, на оборудовании, принадлежащем другим людям. Решение Microsoft в этой категории — самое новое и наименее проверяемое из двух, несмотря на то что исходит от более крупной компании.

Сколько вам на самом деле стоит позвонить по каждому

Gemma 4 12B в исполнении на 12B нет в нашем каталоге — если вам нужен именно такой размер, вы загружаете 11,96 млрд параметров в BF16 и обслуживаете его сами. В нашем каталоге есть остальная линейка Gemma 4, и она недорога: Gemma 4 26B A4B за $0.06 за миллион входных токенов и $0.33 за миллион выходных, а также Gemma 4 31B за $0.13 и $0.38, обе с контекстом в 262 144 токена. Это прайс-листовые цены поставщика, передаваемые без наценки с нашей стороны, за одним ключом, совместимым с OpenAI, наряду с более чем 200 другими моделями. Если ваша задача окажется скорее задачей общего рассуждения, а не выбором из закрытого набора, один из этих двух размеров — дешёвый вариант для измерения против самостоятельно развёрнутого скорера, — а если вы предпочитаете не привязываться к одному генератору, автоматическое переключение при сбое поддерживает работоспособность генерационной части цикла оценки, когда один из провайдеров деградирует.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 — это развертывание Foundry, которое вы подготавливаете самостоятельно, и оно недоступно через нас. Ничто в этой статье не является заявлением о доступности для него — ни с одной из сторон вызова.

Итог

Microsoft-Decision-1 стала общедоступной в Microsoft Foundry 8 октября 2026 года: это текстовая скоринговая модель на 32 768 токенов на базе Qwen3.5-9B, которая возвращает калиброванные вероятности по перечисленным вами вариантам, при нулевом количестве выходных токенов, без открытых весов и без опубликованных показателей бенчмарков. Gemma 4 12B — это мультимодальная универсальная модель без энкодера на 11,96 млрд параметров, выпущенная 3 июня 2026 года под лицензией Apache 2.0, которая умеет рассуждать, воспринимает изображения и аудио и генерирует ответы в пределах 256 000 токенов. Выбирайте по форме вашего ответа, а не по числу параметров: закрытый набор — для скоринговой модели, открытый — для генератора, а платить декодеру за выбор из списка, который вы уже составили, — самый распространённый способ для команд потратить в десять раз больше, чем стоит решение.

В нашем каталоге есть и остальная часть линейки Gemma 4, причём недорого: Gemma 4 26B A4B по цене $0.06 за миллион входных токенов и $0.33 за миллион выходных , а Gemma 4 31B — $0.13 и $0.38.