
Microsoft-Decision-1 против Laya: 25 языков через API, 100+ — после загрузки на 322 МБ
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
Посчитайте языки — и сравнение покажется решённым. Microsoft-Decision-1, общедоступная в Microsoft Foundry с 8 октября 2026 года, перечисляет 25 поддерживаемых языков и прямо заявляет, что охват, качество и калибровка «могут различаться в зависимости от языка», называя неанглийские и особенно низкоресурсные языки зоной недостаточной эффективности. Laya, опубликованная компанией Convai Innovations 18 сентября 2026 года под лицензией Apache 2.0, описывает себя как многоязычную с поддержкой 100+ языков и сообщает, что 45 из 51 протестированного языка остаются пригодными к использованию при маршрутизации, против 23 из 51 у её англоязычного «собрата». Одна — это модель на 9B за конечной точкой Azure с контекстом в 32 768 токенов; другая — классификатор с 421 миллионом параметров, работающий за 32,8 миллисекунды на одно решение на одной Tesla T4, причём бесплатно. Обе отказываются писать ни единого токена, и обе возвращают вероятности по заданным вами вариантам.
Но прочитайте обе карточки моделей целиком — и количество языков перестаёт быть самой интересной цифрой. Интересна история калибровки за ней, и два проекта рассказывают эту историю в противоположных направлениях.
Laya публикует цифру, которая ставит её собственный маркетинг в неловкое положение
В карточке модели Laya в её же разделе ограничений сказано, что базовые чекпоинты набирают 0,362 в режиме zero-shot на бенчмарке typed-decisions — ниже базовой линии 0,461 для класса большинства. Это карточка, которая сообщает вам, что её модель хуже угадывания «самого частого ответа» в этом тесте. Там также сказано, что базовые чекпоинты в режиме zero-shot близки к случайному угадыванию, что заявленный показатель 0,766 на typed-decisions требует дообучения на собственном сплите этого бенчмарка, что вопросы с порядковой оценкой являются самым слабым примитивом (SST-5 0,372), что вопросы выбора с высокой кардинальностью страдают, потому что 77 вариантов оставляют примерно по три-четыре токена на каждый, и что noul может следовать своим собственным меткам, и что поле action.act_probability «пока не несёт полезного сигнала» при AUROC 0,30. Именно итоговое предложение самой Convai следует брать в любую оценку: Laya — это быстрая база для специализации, а не движок принятия решений в режиме zero-shot.
Эта откровенность ценнее, чем кажется, потому что она точно говорит, для чего нужна Laya. Это энкодер, который вы дообучаете на собственных метках — вся архитектура построена так, что новые схемы не требуют переобучения, но для хорошего выполнения задачи оно необходимо. При таком использовании опубликованные цифры впечатляют: 0.766 против 0.727 у Jev на типизированных решениях после дообучения, AG News 0.950 против 0.910, DAIR Emotion 0.595 против 0.480 и ECE 0.081 против 0.246 у Jev — с честной оговоркой, что он поставляется сверхуверенным и требует перенастройки температуры, что сдвигает средний ECE с 0.466 до 0.081.
Microsoft публикует и скрывает результат
Страница Foundry для Microsoft-Decision-1 проводит то же упражнение в обратном направлении. Она подробно описывает оценку — публичные и community-бенчмарки для принятия решений, а также отложенные внутренние наборы, метрики, включая точность и ошибку калибровки, варьирование порядка вариантов, парные статистические тесты, идентичный испытательный стенд для сравниваемых моделей — и сообщает, что модель «показывает результаты на уровне ведущих моделей принятия решений и опережает другие открытые модели принятия решений, оценённые по той же методологии». В ней перечислены её сильные стороны (рассуждения, применение правил, устойчивость к форматированию промптов) и слабые (знания в специализированных предметных областях, неанглийские языки).
А потом она ничего не выводит. Ни показателя точности, ни ошибки калибровки, ни таблицы по отдельным бенчмаркам. Самостоятельно заявленные ограничения реальны и полезны — оценки меняются в зависимости от формулировки и порядка вариантов, плохо сформулированный вопрос всё равно получает оценку, калибровка наиболее сильна на знакомых типах задач, никаких объяснений не приводится — но список ограничений — это не измерение. Так что компромисс на удивление чист: Laya даёт вам числа, которые вы можете попытаться опровергнуть на собственных данных, а Microsoft даёт вам соответствие требованиям и 32K контекста, в который можно поместить длинный документ.

Что на самом деле даёт разница в размере
Малость Laya здесь не компромисс — это и есть замысел. Поскольку каждый вариант оценивается по собственному [MASK] токену и проходит softmax по вариантам этого вопроса, пространство ответов собирается в момент запроса, а не зашито в голову словаря — именно поэтому схема, которую вы придумаете сегодня днём, не требует дообучения, и именно поэтому модель укладывается в 322–421 миллион параметров. Многоязычный чекпойнт работает примерно в 2,2 раза быстрее английского, роутер определяет письменность менее чем за полмиллисекунды, а пакетная пропускная способность достигает 103–332 вопросов в секунду на одной T4. Для нагрузки, которая оценивает каждый тикет, каждый найденный документ или каждое предложенное действие, эта пропускная способность и есть главная фича, а не число параметров.
Издержки такого решения столь же конкретны и заслуживают того, чтобы указать их в противовес альтернативе Microsoft. Английский чекпоинт использует окно в 512 токенов; многоязычный — 1 024, с возможностью расширения до 8K. Microsoft-Decision-1 использует 32 768. Длинная ветка поддержки, полный контракт или многостраничный документ политики вообще не помещаются в окно Laya, и никакая скорость не компенсирует усечение. Laya обрабатывает один набор вопросов за прямой проход с документированным бюджетом токенов на вариант; Microsoft документирует один вызов на до 32K токенов без ограничения на вопрос. И о конкурентной слабости Laya как классификатора стоит знать: она набирает 0,425 на Banking77 против 0,870 у Jev, а это как раз тот тип тонкозернистой задачи с высокой кардинальностью интентов, где специализированный проход значит больше всего.

Сравнение затрат, которое ведётся не по токенам
Laya доступна в точке использования — self-hosted, Apache 2.0, при стоимости self-hosted в $0 — а её настоящая цена — это прогон тонкой настройки, который вы должны ей обеспечить, прежде чем она начнёт хорошо справляться с вашей задачей. Microsoft-Decision-1 — это Foundry с тарифом за токен, который не указан на странице модели, без весов для скачивания, без возможности тонкой настройки и с отключённым пакетным выводом. Один — это предварительный проект по разметке данных, другой — тарифицируемый вызов. Что дешевле, полностью зависит от объёма, и порог перехода высок: кодировщик на 421M, обрабатывающий 300 элементов в секунду на арендованной T4, очень трудно превзойти в расчёте на одно решение, как только он обучен.
Здесь OrcaRouter заслуживает своё место в пайплайне, построенном на любой из этих моделей, и только на генеративной стороне. Мы не размещаем ни Microsoft-Decision-1, ни Laya: обе возвращают вероятности, а не текст, ни одна из них нет в нашем каталоге, и эндпоинт для скоринга — это не цель chat-completions. Что у нас есть — это модель, производящая то, что оценивается: черновик ответа, предлагаемый вызов инструмента, ответ-кандидат, который затем оценивает дообученная голова Laya. Это более 200 моделей за одним ключом, совместимым с OpenAI, по прайс-листу провайдера, передаваемому с наценкой 0 %, с автоматическим переключением при сбое, когда один из путей обслуживания деградирует. В цикле, который оценивает всё, что он генерирует, вызов генерации — это та часть, которая может упасть, и именно переключение при сбое поддерживает поступление заданий в очередь скоринга.

Какой выбрать?
Выбирайте Laya, если ваши решения поступают на многих языках, если ваш объём достаточно высок, что важна цена за токен, если у вас есть метки и неделя на дообучение или если вам нужно запускать скоринг на оборудовании в пределах вашего собственного контура. Примите окно размером от 512 до 1024 токенов и тот факт, что базовый чекпойнт будет близок к случайному угадыванию, пока вы его не специализируете, — и вы получите модель принятия решений, которая честно признаёт, что это лишь отправная точка.
Возьмите Microsoft-Decision-1, если на входе у вас длинные документы, а не тикеты; если ваш шлюз развёртывания — это аутентификация Azure, единый биллинг и пакет Responsible AI, а не скачивание; если 25 языков покрывают ваш трафик; или если вы предпочли бы вообще не владеть моделью. Примите как данность, что первую кривую калибровки вам придётся построить самостоятельно, и заложите полдня на размеченную выборку для этого, — потому что, в отличие от Laya, эта модель не выдаст вам число ECE, с которым можно спорить.
