Сгенерированная титульная карточка с заголовком «TwIL-LM3-Pro vs Qwen 3.8», подзаголовком «Сравнение, которое карточка фактически провела», с двумя карточками со скруглёнными углами и надписями «TwIL-LM3-Pro — 3,66B, локальная, некоммерческая» и «Qwen3.8-Max — хостируемая, контекст 1M, $2 / $6». В нижнем колонтитуле написано «webAI измерялся в сравнении с Qwen3-8B, а не с Qwen3.8-Max». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

TwIL-LM3-Pro против Qwen 3.8: несоответствие и сравнение, которое действительно имеет значение

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

TwIL-LM3-Pro и Qwen3.8-Max не место на одной странице, и причина вовсе не в том, что один из них лучше. Причина в том, что опубликованное обоснование формально-логической модели webAI на 3,66 млрд параметров построено на сравнении с моделью Qwen — и эта модель Qwen не та, что названа в заголовке. Таблицы Track A и Track B у webAI измеряют TwIL-LM3-Pro против Qwen3-8B — плотной модели с открытыми весами на 8 млрд параметров из более раннего поколения — и вовсе не уделяют Qwen3.8-Max никакого внимания: не потому, что TwIL-LM3-Pro одержал бы победу, а потому, что Qwen3.8-Max — это флагманская хостинговая система Alibaba, разреженная модель mixture-of-experts, заявленная как 2,4 триллиона параметров при примерно 95 млрд активных на токен, с мультимодальным контекстным окном на миллион токенов и прайс-листом в $2,00 за миллион входных токенов и $6,00 за миллион выходных. Поставить рядом с этим ноутбучный GGUF на 2,09 ГиБ — это категориальная ошибка, переодетая в страницу сравнения.

Этот материал делает две вещи. Он исправляет сравнение, которое поисковая выдача представляет неверно, а затем отвечает на ту версию вопроса, которая, вероятно, действительно есть у читателя: если передовая модель доступна за один вызов API, а специалист по формальной логике работает на вашей собственной машине, то когда каждая из них оправдывает своё место?

Модель, которую фактически измерила карта

Релевантное сравнение — с Qwen3-8B, и собственное резюме webAI об этом скромнее, чем можно предположить по пересказам из вторых рук. Внутридоменный макро-гейт TwIL-LM3-Pro составляет 0,5539 против 0,5336 у Qwen3-8B, а в карточке модели есть фраза, которую маркетинговая страница бы удалила: преимущество по гейту составляет 0,020 — «меньше шума выборки при n = 200 на лейн, так что воспринимайте это как паритет, а не как победу».

Там, где сравнение не сводится к подбрасыванию монеты: strict-7, 0,2879 против 0,2093 — строка, которая нигде не использует зачёт за нестрогое совпадение и потому не может быть сфабрикована форматированием. Строгий множественный выбор, 0,4100 против 0,0000. Индукция правил, 0,4195 против 0,3680. И соотношение параметров — 3,66 млрд против примерно 8 млрд — в котором и заключается всё утверждение о «менее половины размера».

На отложенном наборе webAI ещё резче: «TwIL-LM3-Pro в нём не лидирует». Макросреднее по десяти наборам данных составляет 0,7901 — на уровне собственной базовой модели Granite и ниже показателя Qwen3-8B 0,8493. Небольшая специализированная модель, которая идёт вровень с универсальной моделью вдвое большего размера в формальной логике и уступает ей по общим возможностям, — это ожидаемая картина, и именно представление результатов таким образом делает показатель strict-7 убедительным.

Что на самом деле представляет собой Qwen3.8-Max

Qwen3.8-Max — это не итерация Qwen3-8B. Это премиальный уровень Alibaba, и на странице каталога OrcaRouter он указан как `qwen/qwen3.8-max` с датой выпуска 3 августа 2026 года, контекстным окном на один миллион токенов, вводом текста, изображений и видео, выводом текста и полной поддержкой режима размышления, вызова функций, встроенных инструментов и структурированных выходных данных. Он обслуживается через OpenAI-совместимые, Anthropic-совместимые и нативные дашборды в пяти регионах, а режим размышления включается и выключается параметром `enable_thinking`. Тариф составляет $2,00 за миллион входных токенов и $6,00 за миллион выходных.

Дата-снимок `qwen/qwen3.8-max-0902` был опубликован 2 сентября 2026 года с теми же возможностями и тем же ценообразованием — опубликован специально, чтобы поведение можно было зафиксировать для воспроизводимых запусков. Если вы строите что-то долгоживущее на базе Qwen3.8-Max, именно этот идентификатор снимка стоит указывать в конфигурации, а не подвижный алиас.

Обратите внимание, чего нет в этом описании: количества параметров, которое можно скачать, файла лицензии и какого-либо способа запустить это самостоятельно. Qwen3.8-Max — это размещённый у провайдера продукт. Журналистские материалы на момент запуска сообщали об открытых весах, обещанных на следующую неделю, и формулировка techsy — «2.4T params, 1M context, no weights yet» — это состояние, которое читателю следует проверить, а не предполагать, потому что обещание, о котором сообщили на запуске, — не опубликованный чекпойнт.

Четыре измерения, и ни одно из них не близко

• Параметры — TwIL-LM3-Pro: 3,66 млрд, плотная модель, все параметры активны, против Qwen3.8-Max, заявленного как 2,4 трлн общих параметров в разреженной архитектуре смеси экспертов с примерно 95 млрд активных на токен. Три порядка разницы по общему числу, два — по активным.

• Где запускается — TwIL-LM3-Pro можно скачать в формате bf16 объёмом 6,82 ГиБ или в виде Q4_K_M GGUF объёмом 2,09 ГиБ для CPU или 4 ГБ VRAM, в отличие от Qwen3.8-Max, который существует только как размещённый эндпоинт.

• Контекст — TwIL-LM3-Pro: 131 072 токена, унаследованные от его базовой модели Granite и никогда не проверявшиеся свыше 8 192 в ходе его собственной оценки против Qwen3.8-Max при 1 000 000 токенов.

• Модальности — текст на входе, текст на выходе против текста, изображения и видео на входе, текст на выходе.

• Лицензия — webAI Non-Commercial License вер. 1.0; для использования, приносящего доход, требуется отдельное соглашение, в отличие от размещённого коммерческого API, где нет весов, подлежащих лицензированию.

• Стоимость — TwIL-LM3-Pro: нет платы за токены и нет хостингового эндпоинта, против $2.00 за миллион входных токенов и $6.00 за миллион выходных у Qwen3.8-Max, при ставке около $0.25 за миллион для кэшированного ввода.

Модель на 3,66 млрд параметров дешева, потому что она мала, а мала она потому, что делает одну вещь. Qwen3.8-Max дорога, потому что она универсальна и размещена на хостинге. Ни одна из этих цен не является приговором.

Вопрос, стоящий за вопросом

Уберите путаницу в названиях — и останется инженерный вопрос, и вопрос хороший: если передовая хостируемая модель умеет рассуждать о формальной логике, зачем вообще запускать узкого специалиста?

Держатся три причины. Первая — лицензия и сеть: некоммерческая исследовательская группа, изолированная от сети среда или пакетный проход разметки, который должен выполняться на ноутбуке без подключения, не может обращаться к размещённой конечной точке, и GGUF размером 2,09 ГиБ напрямую отвечает этому ограничению. Вторая — структура затрат при росте объёма: задача разметки формальной логики на миллионе коротких входных данных оплачивается по токенам на размещённой фронтирной модели и не стоит ничего, кроме затраченного времени, на локальной. Третья — форма вывода: TwIL-LM3-Pro был настроен выдавать структуры, проверяемые машиной, а не прозу, и для меток логического следования и семантических разборов это меньший конвейер, чем запрос к общей модели с последующим разбором её ответа.

В отличие от этого, с Qwen3.8-Max всё просто. Он видит изображения и видео, вмещает миллион токенов, поддерживает инструменты и структурированный вывод через документированный API, а за ним стоят опубликованные бенчмарки и независимая оценка. Ничто в узком специалисте этому не угрожает; эти двое отвечают разным наборам ограничений.

Стек, который использует оба

Схема, которая выживает при соприкосновении с реальным пайплайном, — двухуровневая, и это не экзотика. Передовая облачная модель читает неаккуратный ввод — отсканированную страницу учебника, мультимодальный источник, длинную спецификацию — и превращает его в чистый структурированный текст. Этот текст попадает в локальную модель формальной логики, вся задача которой — выдавать метку, разбор или Lean-критику на принадлежащем вам оборудовании. Вердикт о том, оправдывает ли второй уровень затраты на его поддержку, даёт сравнение в стиле strict-7, а не гейт, потому что специалист заслуживает своё место на тех направлениях, где метрика не оставляет места для снисходительной оценки.

Есть также сигнал, который стоит перенять из собственной карточки webAI: пайплайн запускали на пяти разных базовых моделях, при этом для каждой модели менялся только коэффициент слияния, и webAI сообщает результат для каждой, включая те, которые изменились меньше всего. Это более сильное утверждение о рецепте, чем любая отдельная строка бенчмарка, и это именно тот тип доказательства, который говорит, что метод обобщается, а не что одной контрольной точке просто повезло.

Что здесь можно маршрутизировать, а что нет?

Это единственное место, где две модели честно оказываются в одном предложении. Qwen3.8-Max — это маршрут: он обслуживается через OrcaRouter как `qwen/qwen3.8-max`, и поскольку платформа транслирует прайс-листовую цену провайдера с наценкой 0%, ставка $2.00/$6.00 — это собственная ставка вендора, и снижение цены вендором вступает в силу в тот же день, а не после завершения контрактного цикла. Датированный снапшот `qwen/qwen3.8-max-0902` доступен для маршрутизации наряду с ним, так что закрепление воспроизводимого идентификатора модели — это выбор конфигурации, а не отдельные отношения с вендором.

Twig-LM3 — это не маршрут, и было бы нечестно утверждать обратное. Он имеет некоммерческую лицензию и не имеет опубликованного размещённого эндпоинта, и текущий способ его использования — скачать контрольную точку и запустить её самостоятельно. Что маршрутизатор делает для построенного вокруг него конвейера — это работа с окружающим текстом: расширение подсказки, генерация корпуса, этап фильтрации — которая выполняется на том же OpenAI-совместимом эндпоинте против более чем 200 моделей, так что замена модели, генерирующей оценочные данные, на модель, которая их оценивает, стоит всего лишь правки конфигурации, с автоматическим переключением при сбое, чтобы поддерживать длинный пакет в рабочем состоянии, когда у провайдера случаются сбои.

Наиболее оправданное применение этих двух вместе — именно такое: маршрутизируемый передовой уровень, выполняющий общие рассуждения и структурированное извлечение, загруженная специализированная модель, выносящая суждение на основе формальной логики, и единый ключ для всего, что находится между ними.

Какую модель сравнивать и когда

Если вы оцениваете небольшие модели формальной логики, то Qwen, которого стоит поставить рядом с TwIL-LM3-Pro, — это Qwen3-8B, и это сравнение уже опубликовано в webAI вместе с сопровождающими оговорками. Если вы выбираете, где запускать рабочую нагрузку в продакшене, Qwen3.8-Max — это совсем другое решение: хостируемая фронтирная система с тарифной сеткой и без возможности скачивания, — и правильный вопрос не в том, какая модель лучше, а в том, какое ограничение является связывающим: подключение и лицензия с одной стороны, контекст, модальность и масштаб — с другой. В итоге большинству реальных систем нужны оба ответа.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно