Mage-VL-1
Guides & Insights

Microsoft Mage-VL: кодек-нативная видеомодель 4B, выпущенная без анонса

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В блоге Microsoft нет ни одной публикации о Mage-VL. Нет записи в ленте новостей Azure, нет карточки в каталоге Foundry, нет анонсирующего треда — ничего нет на продуктовых каналах, где Microsoft обычно представляет модели. Вместо этого есть репозиторий на Hugging Face — microsoft/Mage-VL, шесть коммитов, 10,8 ГБ весов, лицензия Apache-2.0 — папка на GitHub со скриптами инференса, страница проекта, которую поддерживает некая «Microsoft Mage Team», и препринт на arXiv с 23 авторами. В совокупности эти артефакты описывают vision-language модель масштаба 4B, чья центральная идея действительно необычна: вместо того чтобы декодировать видео в равномерно распределённые кадры и прогонять плотную сетку патчей через предобученный на веб-данных энкодер, Mage-VL читает сам сжатый битовый поток, используя созданный с нуля энкодер Mage-ViT, который сохраняет только те патчи, на которые кодек потратил биты. Microsoft сообщает, что это сокращает количество визуальных токенов более чем на 75% и даёт ускорение до 3,5 раза по реальному времени, при этом модель не уступает Qwen3-VL-4B на статичных изображениях и превосходит собственную 15B-модель Microsoft Phi-4-Reasoning-Vision на видео.

Последнее предложение — это та часть, к которой стоит относиться с осторожностью. Каждый показатель производительности в этой статье восходит к собственному документу Microsoft, карточке модели или странице проекта. Через десять дней после появления весов ни одна независимая сторона не воспроизвела ни одного из этих результатов, ни один сторонний лидерборд не содержит эту модель, и — как прямо указано на странице Hugging Face — она «не развёрнута ни одним поставщиком инференса», так что нет даже размещённого эндпоинта, который кто-то мог бы неформально прогнать на бенчмарках. Далее мы отделяем то, что репозиторий доказывает, от того, что Microsoft лишь заявляет, потому что при релизе без анонса это совершенно разные категории.

Что на самом деле существует спустя десять дней

Проверяемая поверхность этого релиза невелика, и её стоит точно перечислить.

Веса, датированные 26 июля 2026 года. Два шарда safetensors размером 4,97 ГБ и 4,52 ГБ, плюс отдельный файл 1,07 ГБ под названием streammind_gate.safetensors. Собственный ридер Hugging Face сообщает о 5B параметрах в BF16 — 4B в языковом декодере, остальные распределены между визуальным энкодером и этим гейтом.

Технический отчет, представленный 27 июля 2026 года (arXiv 2607.24904), одна версия, 23 автора, под названием «Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model».

Рабочий код, а не просто веса.Репозиторий содержит modeling_mage_vl.py, processing_mage_vl.py, два видеопроцессора, включая специальный codec_video_processing_mage_vl.py, и streammind_gate.py — около 175 КБ пользовательского кода на Python. auto_map в config.json направляет шесть классов Transformers в эти файлы, поэтому репозиторий помечен тегом custom_code.

Две лицензии, а не одна. Mage-VL распространяется под Apache-2.0; отдельный энкодер Mage-ViT публикуется под MIT.

Рабочее демо, которое не нужно устанавливать. Microsoft запускает microsoft/mage-vl-demo как Hugging Face Space на ZeroGPU, и два Space от сообщества уже используют модель.

Раннее привлечение сообщества, формирующееся быстрее, чем собственные коммуникации вендора.268 лайков, 435 784 загрузки за последний месяц, девять квантизаций сообщества и два файнтюна в дереве моделей. Счётчики загрузок учитывают автоматические и зеркальные запросы, поэтому рассматривайте сырое число как сигнал внимания, а не развёртывания.

Родственная модель. Mage-Flow, модель для генерации изображений по тексту и редактирования по инструкциям, созданная в рамках того же фиксированного бюджета в 4B параметров, вышла на четыре дня раньше, 22 июля. В репозитории GitHub Mage описывается как «семейство лёгких, удобных для исследований мультимодальных моделей» — это самое близкое к позиционированию заявление из всех опубликованных.

В противовес этому, список того, чего не существует, не менее информативен. Не существует ни поста в блоге Microsoft, ни пресс-релиза. Нет записи в Azure AI Foundry, а значит, нет пути корпоративной поддержки, нет SLA, нет управляемой конечной точки. Ни один провайдер инференса её не обслуживает. Нет поддержки vLLM или SGLang: запрос сообщества на добавление Mage-VL в SGLang был подан 28 июля как issue #32646 и, на момент написания, остаётся открытым, без связанного pull request и без ответа мейнтейнера. И не существует никакой независимой оценки — модель отсутствует в нейтральных лидербордах, где утверждение вроде «превосходит 15B-модель на видео» обычно проверяется.

Mage-VL-2

Единственная идея: читать кодек, а не кадры

Почти каждая видеоспособная VLM в продакшене делает одно и то же. Она декодирует видео в RGB-кадры, равномерно сэмплирует их — один кадр в секунду, или 32 кадра на клип, или сколько позволяет бюджет — и пропускает каждый сэмплированный кадр через vision transformer в виде плотной сетки патчей. Каждый патч каждого сэмплированного кадра становится токеном. Статичная стена на заднем плане стоит ровно столько же токенов, сколько и человек, идущий перед ней, и она снова требует их в следующем кадре, и в следующем.

Это колоссальный объём избыточных вычислений, и современные видеокодеки решили эту базовую проблему ещё десятилетия назад. H.264 и HEVC не хранят каждый кадр; они хранят отдельные опорные (I) кадры полностью, а затем описывают кадры между ними через векторы движения и остаточные данные — «этот блок переместился сюда, а вот что изменилось». Интересные части видео — это, почти по построению, те части, на которые кодировщик потратил биты.

Mage-ViT напрямую использует это. Работая с гранулярностью патчей 16×16, он сохраняет каждый патч опорных кадров, а для предсказанных кадров удерживает только те патчи, которые помечены как значимые собственными векторами движения и остаточной энергией кодека — области, несущие реальную информацию, движение или смену сцены, — отбрасывая при этом низкоизбыточные и полностью избыточные. Microsoft оценивает итоговое сокращение визуальных токенов более чем на 75%, при этом пространственно-временной контекст сохраняется, поскольку опорные кадры по-прежнему содержат полную сцену. Дизайн не зависит от кодека: традиционный путь принимает H.264 или HEVC, а нейронный путь — DCVC-RT.

Элегантность заключается в том, что оценка движения уже была выполнена. Каждое сжатое видео в интернете приходит с картой того, где происходит действие, вычисленной энкодером и оплаченной тем, кто его загрузил. Обычный конвейер выбрасывает эту карту в тот момент, когда декодирует видео в RGB, а затем тратит время GPU на повторное обнаружение той же информации. Mage-VL просто отказывается её выбрасывать. Независимо от того, устоят ли цифры бенчмарков, это наблюдение — долговременный вклад — и именно поэтому этот релиз стоит прочитать, даже если вы никогда не скачаете веса.

Mage-VL-3

Самое чистое в эксперименте

В конфигурации скрыто проектное решение, которое делает результаты гораздо более интерпретируемыми, чем при типичном запуске модели, и почти никто из тех, кто освещал этот релиз, на это не указал: языковая модель остаётся фиксированной.

Декодер Mage-VL — это Qwen3-4B-Instruct-2507, без изменений. В качестве базовой модели для сравнения используется Qwen3-VL-4B, которая опирается на тот же бэкбон Qwen3 на 4B, но с обычным веб-предобученным визуальным энкодером. Поэтому, когда Mage-VL превосходит Qwen3-VL-4B, разница объясняется энкодером и токенизацией в формате кодека, а не более крупной или лучше обученной языковой моделью. Это контролируемая абляция, поданная как сравнение продуктов, — и это самое сильное методологическое достоинство релиза.

Это действует и в обратную сторону, и честность требует это признать. Сравнение на одинаковом бэкбоне — самый справедливый тест идеи энкодера и одновременно обрамление, которое с наибольшей вероятностью представит её в выгодном свете: Microsoft выбрала бейзлайн, изолирующий именно её собственный вклад. Сравнения Phi-4 этим свойством не обладают: Phi-4-Reasoning-Vision-15B и Phi-4-MM-5.6B — это разные бэкбоны, разные рецепты обучения, разный пост-тренинг. «Превосходит нашу 15B-модель на видео» — реальный результат, но гораздо менее строгий, а вдобавок это сравнение с более старой работой самой Microsoft, а такие выигрывать проще всего.

Масштаб обучения — ещё одно место, где статья делает по-настоящему удивительное заявление. Mage-ViT был предобучен с нуля на примерно 560 млн немаркированных изображений и 100 млн немаркированных видеокадров — это большой корпус в абсолютных величинах, но ему далеко до миллиардов курируемых пар изображение-текст, стоящих за энкодерами, с которыми он конкурирует. Первый сформулированный вывод статьи заключается в том, что сильному VLM-энкодеру не требуются веб-масштабные размеченные данные. Если это подтвердится при независимой проверке, это будет иметь гораздо большее значение, чем любой отдельный результат в бенчмарке.

Числа и то, кому они принадлежат

Всё нижеследующее — данные от самой Microsoft, полученные на её собственной оценочной платформе в сравнении с базовыми показателями, выбранными Microsoft. Ничто из этого не было воспроизведено третьей стороной. Воспринимайте это как гипотезу с необычно точными границами погрешности, а не как таблицу результатов.

Video-MME — Mage-VL-4B 64.0 против Qwen3-VL-4B 59.7 против Phi-4-Reasoning-Vision-15B 55.3

NExT-QA — 83.1 против 79.8 против 69.0

LongVideoBench — 61.3 против 57.7 против 51.2

VideoEval-Pro — 45.2 против 20.7 для Phi-4

Timelens-QVHighlight (временная локализация) — 57.4 против 34.9 против 11.6

Ref-DAVIS17 (реферальный трекинг) — 25.83 против 7.48 против 2.15

DocVQA-val — 95.14 vs 94.69 vs 92.79 (Phi-4-MM-5.6B)

OCRBench — 81.80 против 81.60 против 81.70

ChartQA — 84.88 vs 83.96 vs 83.40

MMStar — 67.32 против 62.04 против 59.63

RealWorldQA — 70.46 против 70.85 против 70.72, одна из строк, где Mage-VL проигрывает

MMBench-EN-dev — 84.02 против 83.25, при этом Phi-4-Reasoning-Vision-15B превосходит оба показателя с результатом 84.19

CV-Bench-3D / CV-Bench-2D — 94.75 против 92.30, и 82.13 против 81.00

EmbSpatial — 82.67 против 77.50

OVO-Bench (streaming) — 64,00 в общем зачёте, описывается как самый передовой среди потоковых архитектур; подмножество, посвящённое визуальному восприятию в реальном времени, показывает в среднем 79,84% против 72,8% у Qwen3-VL-4B при 1 кадр/с

Mage-ViT как автономный энкодер — выше 86.3% на ImageNet при бюджете в 676 токенов, выше 96.1% на Food-101

Mage-VL-4

Три прочтения этой таблицы стоят больше, чем сама таблица.

На изображениях честное слово — «паритет». DocVQA на 0,45, OCRBench на 0,20, ChartQA на 0,92, MMBench на 0,77 — это в пределах диапазона, где другой шаблон промпта или сид декодирования может поменять порядок мест, а в RealWorldQA на самом деле лидирует Qwen3-VL-4B. Microsoft говорит именно об этом, называя производительность на изображениях паритетом, а не победой, и такая формулировка корректна. Если ваша задача — ответы на вопросы по документам и изображениям, этот релиз не даёт вам повода переходить.

В видео- и темпоральном grounding разрывы велики и устойчивы. Timelens-QVHighlight почти удваивает базовый уровень; Video-MME, NExT-QA и LongVideoBench — все сдвигаются на 3,6–4,3 пункта в том же направлении при фиксированном backbone. Согласованность между бенчмарками, нагружающими разные аспекты, — это та картина, которую следовало бы ожидать, если изменение энкодера реально, а не артефакт настройки.

Две строки не следует цитировать без контекста. Ref-DAVIS17 с результатом 25.83 против 7.48 выглядит как 3.5-кратный разгром, а ключевые пространственные дельты в статье включают +11.0 на VSI-Bench и +53.1 на CrossPoint. Когда базовая модель набирает почти минимальные баллы в задаче, дельта в основном отражает то, какая модель была обучена понимать формат задачи, а не то, какая модель более способна. Та же оговорка относится и к потоковым результатам в абсолютном выражении: на SoccerNet заявленные показатели Mage-VL составляют 55.54 TimVal, 83.14 ROC-AUC и F1 16.35. F1 16.35 — это показатель уровня SOTA в молодом бенчмарке, а не решённая проблема. Проактивное потоковое восприятие находится на ранней стадии, и об этом говорит абсолютный результат лидера.

Ворота: модель, которая решает, когда говорить

Вторая архитектурная идея — та, что имеет наиболее явные последствия для продукта, и она объясняет тот загадочный файл размером 1,07 ГБ.

Mage-VL разделяет потоковую обработку на два процесса, описанных в статье как Система 1 и Система 2. Система 1 — это лёгкий «когнитивный шлюз», который отслеживает каждое скользящее окно признаков кодеков и оценивает вероятность того, что только что завершилось нечто, о чём стоит сказать. Ниже порога он остаётся в бездействии, и дорогостоящая часть модели не запускается. Выше порога активируется полный декодер для формирования ответа. В демонстрационной конфигурации используются каузальные окна длительностью 30 секунд при 1 fps, CLI предоставляет порог напрямую через --gate_threshold, а точка входа потоковой обработки обрабатывает видео по сегментам (inference_streaming.py --video_backend codec --segment_sec 8). На финальном этапе обучается только этот шлюз, на 3.35M потоковых образцов.

В этом стоит отметить две вещи. Во-первых, гейт — это не маленькая классификационная головка, прикрученная сверху: 1,07 ГБ весов в BF16 — это примерно полмиллиарда параметров, то есть полноценная модель сама по себе, поставляемая как отдельный чекпоинт. Во-вторых, имя файла — streammind_gate.safetensors — указывает на то, что этот компонент происходит из более ранних работ по потоковому восприятию, а не был изобретён специально для этой статьи, хотя сам репозиторий не раскрывает эту родословную.

Почему это важно с коммерческой точки зрения: для постоянно работающего видео основная стоимость — не задержка на вызов, а частота вызовов. Видеопоток с камеры, идущий 24/7 через обычную VLM со скоростью 1 кадр в секунду, означает 86 400 прямых проходов в день независимо от того, случилось что-то или нет. Шлюз, который молчит в течение 99% записей, где ничего не происходит, меняет структуру этого счёта, а не только его размер. Достаточно ли точен шлюз Microsoft, чтобы доверить ему такое решение, — именно то, что никто за пределами лаборатории не проверял.

Ты действительно можешь запустить это сегодня?

Да, если у вас есть GPU и терпение. Сложности реальны, и в основном они связаны с видеоконвейером, а не с моделью.

Память.Microsoft не публикует требования к объёму видеопамяти. Из индекса весов: 9.49 ГБ шардов плюс 1.07 ГБ для гейта — это примерно 10.6 ГБ параметров в BF16, так что карта на 16 ГБ — реалистичный минимум для работы с изображениями, а 24 ГБ и более — разумная цель, если добавить KV-кэш для длинного видео или потокового окна. Это арифметика на основе размеров файлов, а не спецификация производителя — измеряйте перед выделением ресурсов.

Пользовательский код обязателен. auto_map указывает все точки входа Transformers на модули самого репозитория, поэтому требуется trust_remote_code. Вы запускаете Python от Microsoft, а не просто загружаете тензоры. Путей через vLLM или SGLang пока нет, а значит, нет ни paged attention, ни непрерывной пакетной обработки, ни производственного стека обслуживания — существенный пробел, если вы надеялись использовать это за конечной точкой.

Кодековый путь требует системных инструментов. FFmpeg и ffprobe должны быть в вашем PATH. Традиционный бэкенд кодеков зависит от пакета codec-video-prep, который предоставляет шаг cv-preinfer; нейронный путь требует DCVC-RT; бэкенд обычных кадров требует Decord. В требования также входят flash-attn и mamba-ssm, которые компилируют расширения CUDA — сначала установите сборку PyTorch, соответствующую вашему тулкиту, или выделите полдня на сборку.

Что конфигурация сообщает вам, а карточка — нет.Максимальные позиционные эмбеддинги — 262 144, поэтому декодер наследует длинный контекст Qwen3-4B. Визуальная часть работает с входом 448 пикселей, патчами 16×16, энкодером на 24 слоя со скрытой размерностью 1024, пространственным объединением 2×2, одним токеном на секунду видео и окном из четырёх кадров. На третьем этапе обучение достигло временной длины в 384 кадра. Потолок в 262K — это не то же самое, что 262K проверенного поведения, а 384 кадра — та длина, с которой модель действительно учили работать.

Известные шероховатости. В открытом обсуждении в репозитории, начатом 4 августа и до сих пор оставшемся без ответа, сообщается о рассогласовании токенов, когда изображения и видео передаются в одном запросе. Программа десятидневной давности ведёт себя как программа десятидневной давности. Если хотите посмотреть без всего этого, Space под управлением Microsoft на ZeroGPU — это вариант без установки.

Строка лицензии не так проста, как "Apache-2.0"

В карточке модели указана лицензия Apache-2.0. У кодировщика Mage-ViT — MIT. Обе лицензии примерно настолько разрешительны, насколько это вообще возможно для открытых весов. Но в репозитории семейства моделей сказано, что «эти модели выпускаются только для исследовательских целей», с акцентом на проверку ответственного ИИ и контроль со стороны человека, — и эта фраза плохо сочетается с лицензией Apache-2.0, которая не ограничивает коммерческое использование. Учтите также зависимости: DCVC-RT и инструментарий подготовки кодеков имеют собственные условия, не зависящие от условий модели.

Для любительского проекта это шум. Для всего, что поставляется клиентам, это та неоднозначность, которую следует передать юрисконсульту до выхода в продакшн, и тот вопрос, который стоит задать в самом репозитории — где, примечательно, в настоящее время нет представителя Microsoft, который бы отвечал.

Стоит ли вам строить на этом?

Решение чётко разделяется по одному признаку: является ли ваша задача потоком или запросом.

Если вы занимаетесь постоянным восприятием — видеопоток с камеры, прямой эфир, поле зрения робота, совещание, которое длится час, — Mage-VL нацелен именно на вас, и экономика самостоятельного хостинга на вашей стороне. Ценообразование API за токен масштабируется в зависимости от количества кадров, что является жестокой моделью для непрерывного видео; 4B-модель на вашем собственном оборудовании с гейтом, который безмолвствует на протяжении неинформативных кадров, — это принципиально иная кривая затрат. Загвоздка в том, что вы также соглашаетесь стать первым человеком за пределами Microsoft, кто узнает, насколько хороши суждения этого гейта.

Если ваша задача имеет форму запроса — пользователь загружает документ, PDF, скриншот, короткий клип и ожидает ответа — то аргументация гораздо слабее. Именно на таких задачах Mage-VL находится на одном уровне с моделью, которую вам всё равно пришлось бы размещать самостоятельно, а управляемые мультимодальные конечные точки — это всего один API-вызов, без GPU, без сборки ffmpeg и без trust_remote_code. В OrcaRouter, Gemini 3.6 Flash стоит $1.50 за миллион входных токенов и $7.50 за миллион выходных, что является прейскурантной ценой провайдера, переданной без изменений — мы берём 0% наценки, поэтому когда вендор снижает цены, скидка появляется у нас в тот же день, а не после пересмотра прайс-листа. Один ключ открывает более 200 моделей с автоматическим переключением при деградации провайдера, что является практической причиной оставить управляемую конечную точку в качестве значения по умолчанию и резервировать самостоятельное размещение для задач, которым это действительно необходимо.

Чтобы быть точным, потому что это различие важно: мы не размещаем Mage-VL, и никто другой тоже. Собственная страница модели на Hugging Face говорит, что ни один провайдер инференса не развернул её. Сегодня запустить её означает запустить её самостоятельно.

Что могло бы изменить это чтение?

Четыре вещи, в примерном порядке того, насколько они были бы важны.

Самое главное — независимая оценка. Каждое число выше — это утверждение, и утверждение, которое больше всего нуждается в проверке, — не оценка бенчмарка, а ускорение в 3,5 раза, измеренное на NExT-QA по сравнению с равномерной выборкой кадров без опубликованных данных об оборудовании, разрешении или количестве кадров. Предварительная обработка кодеком переносит реальную работу на CPU и в ffmpeg; единственная версия этой цифры, на которую стоит опираться при планировании, — это выигрыш по реальному времени, измеренный от начала до конца на чужой машине.

Во-вторых, поддержка сервинга. Объединённая реализация vLLM или SGLang превратила бы это из исследовательского чекпоинта во что-то, что можно разместить за балансировщиком нагрузки. Issue в SGLang открыт и никем не занят; именно за этим тредом стоит следить.

В-третьих, размещение в Azure AI Foundry, что свидетельствовало бы о том, что Microsoft намерена представить это как продукт, а не как статью. Ничто в текущем релизе не указывает на то, что это произойдет в ближайшее время.

В-четвертых, и что самое странное: скажет ли Microsoft вообще хоть что-либо. Технический отчет с 23 авторами, поддерживаемая страница проекта, размещенное демо Space и родственная генеративная модель четырьмя днями ранее свидетельствуют не об утечке или случайности, а о намеренной публикации исследования, полностью обошедшейся без продуктового рупора. Сообщество в любом случае заполнило тишину, выпустив за десять дней девять квантизаций и два файнтюна.

Для большинства команд правильный шаг — прочитать статью, а не скачивать веса. Главный вывод — кодек-нативная идея, и она переносима: если повторное использование векторов движения, уже вычисленных энкодером, действительно даёт сокращение токенов на 75% при той же точности, эта техника появится в моделях с анонсами, поддержкой провайдеров и воспроизводимыми бенчмарками. Если вы сегодня работаете с непрерывным видео, расчёт другой — клонируйте репозиторий, прогоните свои клипы через оба бэкенда и замерьте ускорение сами, потому что сейчас вы будете первыми.

Вопросы, которые действительно стоит задавать

Mage-VL — это просто Qwen3-VL с наклейкой Microsoft?

Нет, хотя путаница понятна. Языковой декодер — это Qwen3-4B-Instruct-2507, используемый как есть: Microsoft не обучала новую LLM. Всё остальное новое: Mage-ViT была предобучена с нуля, кодек-нативная токенизация не имеет аналогов в Qwen3-VL, а стриминговый гейт — это дополнительная модель на полмиллиарда параметров. Повторное использование открытого backbone и замена визуального фронтенда — это легитимная и всё более распространённая исследовательская стратегия, и здесь она же делает прямое сравнение интерпретируемым. Если у вас есть требования соответствия в отношении происхождения модели, учтите, что линия происхождения идёт через веса Qwen3 от Alibaba, и проверьте обе лицензии.

Означает ли «в 3,5 раза быстрее», что обслуживание будет в 3,5 раза дешевле?

Не надёжно. Эта цифра — ускорение в реальном времени на NExT-QA по сравнению с равномерной выборкой кадров, и Microsoft подаёт её как «до». На практике её размывают две вещи. Кодеко-нативный инференс требует подготовительного прохода — ffmpeg, ffprobe и шаг cv-preinfer, либо перекодирование DCVC-RT для нейросетевого пути, — который потребляет время CPU, которого нет у наивного конвейера кадров и которое не отображается в замерах на стороне GPU. А выигрыш достигается за счёт сокращения токенов, так что он масштабируется в зависимости от того, насколько избыточен ваш материал: в основном статичная камера наблюдения должна показать результат лучше указанной цифры, а быстро смонтированное видео, где меняется почти каждый патч, — хуже. Измерьте это на своих собственных клипах.

Нужны ли специальные видеофайлы для использования пути кодека?

В основном нет, и это приятный сюрприз. Обычные MP4-файлы уже содержат H.264 или HEVC — именно то, что потребляет традиционный бэкенд кодеков: векторы движения, которые ему нужны, уже находятся в вашем файле. Что нужно добавить — это инструменты: FFmpeg и ffprobe в PATH, плюс пакет подготовки кодеков. Нейронный бэкенд — исключение: DCVC-RT ожидает видео, закодированное этим кодеком, так что вам пришлось бы перекодировать. А бэкенд обычных кадров остаётся доступным как запасной вариант, который работает как любая другая VLM — это также честный способ самому проверить утверждение о кодеке методом A/B.

Можно ли использовать его в коммерческих целях?

Лицензия указана как Apache-2.0, которая разрешает коммерческое использование, модификацию и распространение. В репозитории также сказано, что модели «выпущены только для исследовательских целей». Эти два заявления указывают в разных направлениях, и это расхождение никто из Microsoft не прояснил — что неудивительно для релиза без анонса, без страницы продукта и без присутствия представителей вендора в обсуждениях репозитория. Если от ответа зависят деньги, наймите юриста, чтобы он изучил оба документа и лицензии зависимостей, а не полагайтесь только на бейдж лицензии.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube