Сгенерированная титульная карточка для Microsoft-Decision-1 vs Laya с подзаголовком «языковой охват против длины контекста», с чипами: 25 поддерживаемых языков против 100+ языков, контекст на 32 768 токенов против окна в 1 024 токена, только хостируемый API против весов Apache-2.0, и футер с примечанием, что показатели обоих вендоров приведены ими самими.
Engineering & Research

Microsoft-Decision-1 против Laya: 25 языков через API, 100+ — после загрузки на 322 МБ

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Посчитайте языки — и сравнение покажется решённым. Microsoft-Decision-1, общедоступная в Microsoft Foundry с 8 октября 2026 года, перечисляет 25 поддерживаемых языков и прямо заявляет, что охват, качество и калибровка «могут различаться в зависимости от языка», называя неанглийские и особенно низкоресурсные языки зоной недостаточной эффективности. Laya, опубликованная компанией Convai Innovations 18 сентября 2026 года под лицензией Apache 2.0, описывает себя как многоязычную с поддержкой 100+ языков и сообщает, что 45 из 51 протестированного языка остаются пригодными к использованию при маршрутизации, против 23 из 51 у её англоязычного «собрата». Одна — это модель на 9B за конечной точкой Azure с контекстом в 32 768 токенов; другая — классификатор с 421 миллионом параметров, работающий за 32,8 миллисекунды на одно решение на одной Tesla T4, причём бесплатно. Обе отказываются писать ни единого токена, и обе возвращают вероятности по заданным вами вариантам.

Но прочитайте обе карточки моделей целиком — и количество языков перестаёт быть самой интересной цифрой. Интересна история калибровки за ней, и два проекта рассказывают эту историю в противоположных направлениях.

Laya публикует цифру, которая ставит её собственный маркетинг в неловкое положение

В карточке модели Laya в её же разделе ограничений сказано, что базовые чекпоинты набирают 0,362 в режиме zero-shot на бенчмарке typed-decisions — ниже базовой линии 0,461 для класса большинства. Это карточка, которая сообщает вам, что её модель хуже угадывания «самого частого ответа» в этом тесте. Там также сказано, что базовые чекпоинты в режиме zero-shot близки к случайному угадыванию, что заявленный показатель 0,766 на typed-decisions требует дообучения на собственном сплите этого бенчмарка, что вопросы с порядковой оценкой являются самым слабым примитивом (SST-5 0,372), что вопросы выбора с высокой кардинальностью страдают, потому что 77 вариантов оставляют примерно по три-четыре токена на каждый, и что noul может следовать своим собственным меткам, и что поле action.act_probability «пока не несёт полезного сигнала» при AUROC 0,30. Именно итоговое предложение самой Convai следует брать в любую оценку: Laya — это быстрая база для специализации, а не движок принятия решений в режиме zero-shot.

Эта откровенность ценнее, чем кажется, потому что она точно говорит, для чего нужна Laya. Это энкодер, который вы дообучаете на собственных метках — вся архитектура построена так, что новые схемы не требуют переобучения, но для хорошего выполнения задачи оно необходимо. При таком использовании опубликованные цифры впечатляют: 0.766 против 0.727 у Jev на типизированных решениях после дообучения, AG News 0.950 против 0.910, DAIR Emotion 0.595 против 0.480 и ECE 0.081 против 0.246 у Jev — с честной оговоркой, что он поставляется сверхуверенным и требует перенастройки температуры, что сдвигает средний ECE с 0.466 до 0.081.

Microsoft публикует и скрывает результат

Страница Foundry для Microsoft-Decision-1 проводит то же упражнение в обратном направлении. Она подробно описывает оценку — публичные и community-бенчмарки для принятия решений, а также отложенные внутренние наборы, метрики, включая точность и ошибку калибровки, варьирование порядка вариантов, парные статистические тесты, идентичный испытательный стенд для сравниваемых моделей — и сообщает, что модель «показывает результаты на уровне ведущих моделей принятия решений и опережает другие открытые модели принятия решений, оценённые по той же методологии». В ней перечислены её сильные стороны (рассуждения, применение правил, устойчивость к форматированию промптов) и слабые (знания в специализированных предметных областях, неанглийские языки).

А потом она ничего не выводит. Ни показателя точности, ни ошибки калибровки, ни таблицы по отдельным бенчмаркам. Самостоятельно заявленные ограничения реальны и полезны — оценки меняются в зависимости от формулировки и порядка вариантов, плохо сформулированный вопрос всё равно получает оценку, калибровка наиболее сильна на знакомых типах задач, никаких объяснений не приводится — но список ограничений — это не измерение. Так что компромисс на удивление чист: Laya даёт вам числа, которые вы можете попытаться опровергнуть на собственных данных, а Microsoft даёт вам соответствие требованиям и 32K контекста, в который можно поместить длинный документ.

A generated two-column scoreboard for Microsoft-Decision-1 and Laya across six shared dimensions: architecture a 9B dense decoder post-trained by Microsoft versus a 421M ModernBERT-large with a from-scratch decision head; languages 25 supported with coverage caveats versus 100+ with 45 of 51 usable; context 32,768 tokens versus a 512-token English checkpoint and a 1,024-token multilingual one; published calibration none versus vendor-reported ECE 0.081 after temperature refitting; fine-tuning not available versus a documented specialisation path; and cost a Foundry per-token rate versus zero on your own hardware. A footer notes both sides are vendor-reported and neither is independently audited.

Что на самом деле даёт разница в размере

Малость Laya здесь не компромисс — это и есть замысел. Поскольку каждый вариант оценивается по собственному [MASK] токену и проходит softmax по вариантам этого вопроса, пространство ответов собирается в момент запроса, а не зашито в голову словаря — именно поэтому схема, которую вы придумаете сегодня днём, не требует дообучения, и именно поэтому модель укладывается в 322–421 миллион параметров. Многоязычный чекпойнт работает примерно в 2,2 раза быстрее английского, роутер определяет письменность менее чем за полмиллисекунды, а пакетная пропускная способность достигает 103–332 вопросов в секунду на одной T4. Для нагрузки, которая оценивает каждый тикет, каждый найденный документ или каждое предложенное действие, эта пропускная способность и есть главная фича, а не число параметров.

Издержки такого решения столь же конкретны и заслуживают того, чтобы указать их в противовес альтернативе Microsoft. Английский чекпоинт использует окно в 512 токенов; многоязычный — 1 024, с возможностью расширения до 8K. Microsoft-Decision-1 использует 32 768. Длинная ветка поддержки, полный контракт или многостраничный документ политики вообще не помещаются в окно Laya, и никакая скорость не компенсирует усечение. Laya обрабатывает один набор вопросов за прямой проход с документированным бюджетом токенов на вариант; Microsoft документирует один вызов на до 32K токенов без ограничения на вопрос. И о конкурентной слабости Laya как классификатора стоит знать: она набирает 0,425 на Banking77 против 0,870 у Jev, а это как раз тот тип тонкозернистой задачи с высокой кардинальностью интентов, где специализированный проход значит больше всего.

A screenshot of the Laya model card on Hugging Face, read 10 October 2026, showing the convaiinnovations organisation, a TextClassification pipeline tag, Transformers and Safetensors badges, and the Laya and system-one tags on the model page.

Сравнение затрат, которое ведётся не по токенам

Laya доступна в точке использования — self-hosted, Apache 2.0, при стоимости self-hosted в $0 — а её настоящая цена — это прогон тонкой настройки, который вы должны ей обеспечить, прежде чем она начнёт хорошо справляться с вашей задачей. Microsoft-Decision-1 — это Foundry с тарифом за токен, который не указан на странице модели, без весов для скачивания, без возможности тонкой настройки и с отключённым пакетным выводом. Один — это предварительный проект по разметке данных, другой — тарифицируемый вызов. Что дешевле, полностью зависит от объёма, и порог перехода высок: кодировщик на 421M, обрабатывающий 300 элементов в секунду на арендованной T4, очень трудно превзойти в расчёте на одно решение, как только он обучен.

Здесь OrcaRouter заслуживает своё место в пайплайне, построенном на любой из этих моделей, и только на генеративной стороне. Мы не размещаем ни Microsoft-Decision-1, ни Laya: обе возвращают вероятности, а не текст, ни одна из них нет в нашем каталоге, и эндпоинт для скоринга — это не цель chat-completions. Что у нас есть — это модель, производящая то, что оценивается: черновик ответа, предлагаемый вызов инструмента, ответ-кандидат, который затем оценивает дообученная голова Laya. Это более 200 моделей за одним ключом, совместимым с OpenAI, по прайс-листу провайдера, передаваемому с наценкой 0 %, с автоматическим переключением при сбое, когда один из путей обслуживания деградирует. В цикле, который оценивает всё, что он генерирует, вызов генерации — это та часть, которая может упасть, и именно переключение при сбое поддерживает поступление заданий в очередь скоринга.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Laya nor Microsoft-Decision-1 appears.

Какой выбрать?

Выбирайте Laya, если ваши решения поступают на многих языках, если ваш объём достаточно высок, что важна цена за токен, если у вас есть метки и неделя на дообучение или если вам нужно запускать скоринг на оборудовании в пределах вашего собственного контура. Примите окно размером от 512 до 1024 токенов и тот факт, что базовый чекпойнт будет близок к случайному угадыванию, пока вы его не специализируете, — и вы получите модель принятия решений, которая честно признаёт, что это лишь отправная точка.

Возьмите Microsoft-Decision-1, если на входе у вас длинные документы, а не тикеты; если ваш шлюз развёртывания — это аутентификация Azure, единый биллинг и пакет Responsible AI, а не скачивание; если 25 языков покрывают ваш трафик; или если вы предпочли бы вообще не владеть моделью. Примите как данность, что первую кривую калибровки вам придётся построить самостоятельно, и заложите полдня на размеченную выборку для этого, — потому что, в отличие от Laya, эта модель не выдаст вам число ECE, с которым можно спорить.