
TwIL-LM3-Pro против Qwen 3.8: несоответствие и сравнение, которое действительно имеет значение
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
TwIL-LM3-Pro и Qwen3.8-Max не место на одной странице, и причина вовсе не в том, что один из них лучше. Причина в том, что опубликованное обоснование формально-логической модели webAI на 3,66 млрд параметров построено на сравнении с моделью Qwen — и эта модель Qwen не та, что названа в заголовке. Таблицы Track A и Track B у webAI измеряют TwIL-LM3-Pro против Qwen3-8B — плотной модели с открытыми весами на 8 млрд параметров из более раннего поколения — и вовсе не уделяют Qwen3.8-Max никакого внимания: не потому, что TwIL-LM3-Pro одержал бы победу, а потому, что Qwen3.8-Max — это флагманская хостинговая система Alibaba, разреженная модель mixture-of-experts, заявленная как 2,4 триллиона параметров при примерно 95 млрд активных на токен, с мультимодальным контекстным окном на миллион токенов и прайс-листом в $2,00 за миллион входных токенов и $6,00 за миллион выходных. Поставить рядом с этим ноутбучный GGUF на 2,09 ГиБ — это категориальная ошибка, переодетая в страницу сравнения.
Этот материал делает две вещи. Он исправляет сравнение, которое поисковая выдача представляет неверно, а затем отвечает на ту версию вопроса, которая, вероятно, действительно есть у читателя: если передовая модель доступна за один вызов API, а специалист по формальной логике работает на вашей собственной машине, то когда каждая из них оправдывает своё место?
Модель, которую фактически измерила карта
Релевантное сравнение — с Qwen3-8B, и собственное резюме webAI об этом скромнее, чем можно предположить по пересказам из вторых рук. Внутридоменный макро-гейт TwIL-LM3-Pro составляет 0,5539 против 0,5336 у Qwen3-8B, а в карточке модели есть фраза, которую маркетинговая страница бы удалила: преимущество по гейту составляет 0,020 — «меньше шума выборки при n = 200 на лейн, так что воспринимайте это как паритет, а не как победу».
Там, где сравнение не сводится к подбрасыванию монеты: strict-7, 0,2879 против 0,2093 — строка, которая нигде не использует зачёт за нестрогое совпадение и потому не может быть сфабрикована форматированием. Строгий множественный выбор, 0,4100 против 0,0000. Индукция правил, 0,4195 против 0,3680. И соотношение параметров — 3,66 млрд против примерно 8 млрд — в котором и заключается всё утверждение о «менее половины размера».
На отложенном наборе webAI ещё резче: «TwIL-LM3-Pro в нём не лидирует». Макросреднее по десяти наборам данных составляет 0,7901 — на уровне собственной базовой модели Granite и ниже показателя Qwen3-8B 0,8493. Небольшая специализированная модель, которая идёт вровень с универсальной моделью вдвое большего размера в формальной логике и уступает ей по общим возможностям, — это ожидаемая картина, и именно представление результатов таким образом делает показатель strict-7 убедительным.
Что на самом деле представляет собой Qwen3.8-Max
Qwen3.8-Max — это не итерация Qwen3-8B. Это премиальный уровень Alibaba, и на странице каталога OrcaRouter он указан как `qwen/qwen3.8-max` с датой выпуска 3 августа 2026 года, контекстным окном на один миллион токенов, вводом текста, изображений и видео, выводом текста и полной поддержкой режима размышления, вызова функций, встроенных инструментов и структурированных выходных данных. Он обслуживается через OpenAI-совместимые, Anthropic-совместимые и нативные дашборды в пяти регионах, а режим размышления включается и выключается параметром `enable_thinking`. Тариф составляет $2,00 за миллион входных токенов и $6,00 за миллион выходных.
Дата-снимок `qwen/qwen3.8-max-0902` был опубликован 2 сентября 2026 года с теми же возможностями и тем же ценообразованием — опубликован специально, чтобы поведение можно было зафиксировать для воспроизводимых запусков. Если вы строите что-то долгоживущее на базе Qwen3.8-Max, именно этот идентификатор снимка стоит указывать в конфигурации, а не подвижный алиас.
Обратите внимание, чего нет в этом описании: количества параметров, которое можно скачать, файла лицензии и какого-либо способа запустить это самостоятельно. Qwen3.8-Max — это размещённый у провайдера продукт. Журналистские материалы на момент запуска сообщали об открытых весах, обещанных на следующую неделю, и формулировка techsy — «2.4T params, 1M context, no weights yet» — это состояние, которое читателю следует проверить, а не предполагать, потому что обещание, о котором сообщили на запуске, — не опубликованный чекпойнт.
Четыре измерения, и ни одно из них не близко
• Параметры — TwIL-LM3-Pro: 3,66 млрд, плотная модель, все параметры активны, против Qwen3.8-Max, заявленного как 2,4 трлн общих параметров в разреженной архитектуре смеси экспертов с примерно 95 млрд активных на токен. Три порядка разницы по общему числу, два — по активным.
• Где запускается — TwIL-LM3-Pro можно скачать в формате bf16 объёмом 6,82 ГиБ или в виде Q4_K_M GGUF объёмом 2,09 ГиБ для CPU или 4 ГБ VRAM, в отличие от Qwen3.8-Max, который существует только как размещённый эндпоинт.
• Контекст — TwIL-LM3-Pro: 131 072 токена, унаследованные от его базовой модели Granite и никогда не проверявшиеся свыше 8 192 в ходе его собственной оценки против Qwen3.8-Max при 1 000 000 токенов.
• Модальности — текст на входе, текст на выходе против текста, изображения и видео на входе, текст на выходе.
• Лицензия — webAI Non-Commercial License вер. 1.0; для использования, приносящего доход, требуется отдельное соглашение, в отличие от размещённого коммерческого API, где нет весов, подлежащих лицензированию.
• Стоимость — TwIL-LM3-Pro: нет платы за токены и нет хостингового эндпоинта, против $2.00 за миллион входных токенов и $6.00 за миллион выходных у Qwen3.8-Max, при ставке около $0.25 за миллион для кэшированного ввода.
Модель на 3,66 млрд параметров дешева, потому что она мала, а мала она потому, что делает одну вещь. Qwen3.8-Max дорога, потому что она универсальна и размещена на хостинге. Ни одна из этих цен не является приговором.
Вопрос, стоящий за вопросом
Уберите путаницу в названиях — и останется инженерный вопрос, и вопрос хороший: если передовая хостируемая модель умеет рассуждать о формальной логике, зачем вообще запускать узкого специалиста?
Держатся три причины. Первая — лицензия и сеть: некоммерческая исследовательская группа, изолированная от сети среда или пакетный проход разметки, который должен выполняться на ноутбуке без подключения, не может обращаться к размещённой конечной точке, и GGUF размером 2,09 ГиБ напрямую отвечает этому ограничению. Вторая — структура затрат при росте объёма: задача разметки формальной логики на миллионе коротких входных данных оплачивается по токенам на размещённой фронтирной модели и не стоит ничего, кроме затраченного времени, на локальной. Третья — форма вывода: TwIL-LM3-Pro был настроен выдавать структуры, проверяемые машиной, а не прозу, и для меток логического следования и семантических разборов это меньший конвейер, чем запрос к общей модели с последующим разбором её ответа.
В отличие от этого, с Qwen3.8-Max всё просто. Он видит изображения и видео, вмещает миллион токенов, поддерживает инструменты и структурированный вывод через документированный API, а за ним стоят опубликованные бенчмарки и независимая оценка. Ничто в узком специалисте этому не угрожает; эти двое отвечают разным наборам ограничений.
Стек, который использует оба
Схема, которая выживает при соприкосновении с реальным пайплайном, — двухуровневая, и это не экзотика. Передовая облачная модель читает неаккуратный ввод — отсканированную страницу учебника, мультимодальный источник, длинную спецификацию — и превращает его в чистый структурированный текст. Этот текст попадает в локальную модель формальной логики, вся задача которой — выдавать метку, разбор или Lean-критику на принадлежащем вам оборудовании. Вердикт о том, оправдывает ли второй уровень затраты на его поддержку, даёт сравнение в стиле strict-7, а не гейт, потому что специалист заслуживает своё место на тех направлениях, где метрика не оставляет места для снисходительной оценки.
Есть также сигнал, который стоит перенять из собственной карточки webAI: пайплайн запускали на пяти разных базовых моделях, при этом для каждой модели менялся только коэффициент слияния, и webAI сообщает результат для каждой, включая те, которые изменились меньше всего. Это более сильное утверждение о рецепте, чем любая отдельная строка бенчмарка, и это именно тот тип доказательства, который говорит, что метод обобщается, а не что одной контрольной точке просто повезло.
Что здесь можно маршрутизировать, а что нет?
Это единственное место, где две модели честно оказываются в одном предложении. Qwen3.8-Max — это маршрут: он обслуживается через OrcaRouter как `qwen/qwen3.8-max`, и поскольку платформа транслирует прайс-листовую цену провайдера с наценкой 0%, ставка $2.00/$6.00 — это собственная ставка вендора, и снижение цены вендором вступает в силу в тот же день, а не после завершения контрактного цикла. Датированный снапшот `qwen/qwen3.8-max-0902` доступен для маршрутизации наряду с ним, так что закрепление воспроизводимого идентификатора модели — это выбор конфигурации, а не отдельные отношения с вендором.
Twig-LM3 — это не маршрут, и было бы нечестно утверждать обратное. Он имеет некоммерческую лицензию и не имеет опубликованного размещённого эндпоинта, и текущий способ его использования — скачать контрольную точку и запустить её самостоятельно. Что маршрутизатор делает для построенного вокруг него конвейера — это работа с окружающим текстом: расширение подсказки, генерация корпуса, этап фильтрации — которая выполняется на том же OpenAI-совместимом эндпоинте против более чем 200 моделей, так что замена модели, генерирующей оценочные данные, на модель, которая их оценивает, стоит всего лишь правки конфигурации, с автоматическим переключением при сбое, чтобы поддерживать длинный пакет в рабочем состоянии, когда у провайдера случаются сбои.
Наиболее оправданное применение этих двух вместе — именно такое: маршрутизируемый передовой уровень, выполняющий общие рассуждения и структурированное извлечение, загруженная специализированная модель, выносящая суждение на основе формальной логики, и единый ключ для всего, что находится между ними.
Какую модель сравнивать и когда
Если вы оцениваете небольшие модели формальной логики, то Qwen, которого стоит поставить рядом с TwIL-LM3-Pro, — это Qwen3-8B, и это сравнение уже опубликовано в webAI вместе с сопровождающими оговорками. Если вы выбираете, где запускать рабочую нагрузку в продакшене, Qwen3.8-Max — это совсем другое решение: хостируемая фронтирная система с тарифной сеткой и без возможности скачивания, — и правильный вопрос не в том, какая модель лучше, а в том, какое ограничение является связывающим: подключение и лицензия с одной стороны, контекст, модальность и масштаб — с другой. В итоге большинству реальных систем нужны оба ответа.



Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
