
TwIL-LM3-Pro против Gemma 4 12B: две локальные модели, у которых нет ничего общего, кроме ноутбука
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Поставьте TwIL-LM3-Pro и Gemma 4 12B рядом, и сходства реальны, но поверхностны: оба — открытые чекпоинты, которые можно скачать уже сегодня, оба работают на потребительском оборудовании без облачного аккаунта, и оба будут отвечать на вопросы офлайн. Всё, что дальше, расходится, и самое резкое расхождение — юридическое, а не техническое. TwIL-LM3-Pro, специалист webAI по формальной логике на 3,66 млрд параметров, поставляется под лицензией webAI Non-Commercial License версии 1.0 — вы можете исследовать с его помощью, но не можете строить на нём бизнес без отдельного соглашения. Gemma 4 12B, мультимодальная модель без энкодера от Google DeepMind, поставляется под Apache 2.0. Эта единственная строка решает больше внедрений, чем таблица бенчмарков, так что стоит начать с неё, а не закончить ею.
Это сравнение специалиста и универсала, которые оказались объектами одного и того же типа. TwIL-LM3-Pro выполняет одну задачу — формальную логику — и делает это лучше, чем модели, в несколько раз крупнее её. Gemma 4 12B выполняет множество задач, видит и слышит так же, как читает, и намеренно создана как модель малого размера по умолчанию в чужом продукте. Сравнивать их спецификации друг с другом так, будто они соревнуются за одно и то же место, — это ошибка, которую и призвана предотвратить эта страница.
Лицензия — это первая спецификация.
Лицензия TwIL-LM3-Pro разрешает воспроизведение, исследования и личное использование, а также явно требует отдельного соглашения с webAI для развёртывания, приносящего доход. Она также ограничивает использование торговых наименований и знаков webAI без письменного согласия. Для любителя, аспиранта или внутренней исследовательской группы это полное разрешение. Для любого, кто выпускает продукт, это жёсткий стоп, пока не заключено соглашение, — а коммерческий путь webAI представляет собой корпоративную договорённость, а не опубликованный прайс-лист.
Gemma 4 12B распространяется под лицензией Apache 2.0. Вы можете дообучать её, распространять производные, предоставлять её клиентам и поставлять в составе коммерческого продукта при условии соблюдения политики использования Google. Это не небольшое различие в степени; это разница между моделью, которую можно оценить, и моделью, на которой можно строить.
Обе представляют собой загрузки без ограничений на Hugging Face, так что лицензия — единственный барьер, и он вполне реальный.
Для чего на самом деле предназначена каждая модель
TwIL-LM3-Pro происходит от `ibm-granite/granite-4.2-3b` через пятиэтапный конвейер — LoRA-дообучение с учителем на синтетическом корпусе формальной логики, многопутевую дистилляцию, слияние контрольных точек, WiSE-FT-интерполяцию обратно к предобученной базе и этап GRPO со взвешиванием по энтропии против программного верификатора. Его целевые выходные данные — это объекты, а не текст: переводы в логику первого порядка, метки следования, семантические разборы, утверждения Lean и критика доказательств Lean. webAI прямо заявляет, что модель не является универсальным ассистентом и не несёт настройки безопасности или предпочтений сверх того, что содержала Granite 4.2.
Gemma 4 12B — это противоположная конструкция. Это плотный представитель семейства Gemma 4 с 11,95 млрд параметров — 48 слоёв, словарь на 262 тыс. токенов, контекстное окно на 256 тыс. токенов — и она нативно мультимодальна: обрабатывает текст, изображения и аудио через архитектуру без энкодера, а не за счёт прикручивания отдельных визуальных и аудиобашен. Все модели Gemma 4 поставляются с настраиваемыми режимами размышления, встроенной поддержкой системных промптов и вызовом функций. Она задумана как универсальная рабочая лошадка для рассуждений и мультимодальных задач такого размера, который помещается на потребительский GPU.
Просить TwIL-LM3-Pro описать фотографию — это несправедливый тест, и это не тот тест, для которого модель создавалась. Просить Gemma 4 12B выдать семантический разбор в фиксированной схеме — тоже не та задача, для которой она настраивалась. Пересечение реально, но узко: обе способны рассуждать, и обе могут работать офлайн.
Измерения, которые действительно различаются
• Параметры — TwIL-LM3-Pro 3,66B (плотная) против Gemma 4 12B 11,95B (плотная), примерно в 3,3 раза.
• Контекстное окно — TwIL-LM3-Pro: 131 072 токена, унаследовано без изменений от базовой модели Granite; Gemma 4 12B: 256 000 токенов.
• Модальности в — TwIL-LM3-Pro только текст; Gemma 4 12B текст, изображение, видео и аудио.
• Лицензия — webAI Non-Commercial License ver. 1.0 против Apache 2.0.
• Базовая модель — `ibm-granite/granite-4.2-3b` против собственного предобучения Gemma 4 от Google, опубликованного вместе с техническим отчётом.
• Формат мышления — TwIL-LM3-Pro по умолчанию выводит блок `<think>` перед ответом; Gemma 4 предоставляет настраиваемые режимы мышления во всей линейке.
• Квантованный объём — TwIL-LM3-Pro Q4_K_M занимает 2,09 ГиБ и запускается на CPU или при 4 ГБ VRAM; Gemma 4 12B в bf16 — примерно 24 ГиБ, рассчитан на потребительскую видеокарту, а не на встроенную графику ноутбука.
Именно эта последняя строка сильнее всего подрывает формулировку «оба работают локально», и тут стоит быть точным. Локальность TwIL-LM3-Pro — это локальность ноутбука. Локальность Gemma 4 12B — это локальность рабочей станции с GPU, тогда как меньшие модели Google E2B и E4B отвечают за по-настоящему телефонно-ноутбучный сегмент. Две модели, обе называемые локальными, — это не одна и та же аппаратная планка.
Как обстоят дела с доказательной базой бенчмарка
Каждый показатель производительности TwIL-LM3-Pro взят из собственной карточки модели webAI и измерен на собственных стендах компании Track A и Track B. Независимой оценки пока не существует. Сравнение, которое сама карточка выделяет, — это сравнение с Qwen3-8B, а не с какой-либо моделью Gemma: макро-гейт webAI 0,5539 против 0,5336 у Qwen3-8B с преимуществом, которое карточка описывает как находящееся в пределах шума выборки, и strict-7 0,2879 против 0,2093, где разрыв не зависит от зачёта за нестрогое совпадение. По сравнению с собственной базой Granite 4.2 3B макро-гейт в пределах домена растёт с 0,4313 до 0,5539, тогда как макро на отложенных 10 наборах данных остаётся на уровне 0,7901 против 0,7942.
У Gemma 4 12B есть опубликованный технический отчёт и широкий корпус сторонних оценок. У неё также есть заявленная производителем позиция в бенчмарках внутри собственного семейства — Google ставит сборку 12B Unified ниже 31B и 26B A4B в своих собственных таблицах по рассуждениям и программированию. Этот рейтинг принадлежит Google, и его стоит цитировать именно как таковой.
Честная формулировка насчёт прямого очного сравнения такова: его не существует. Никто не прогонял TwIL-LM3-Pro и Gemma 4 12B через общий тестовый стенд и не публиковал результат. Обе эти модели никто никогда не оценивал по одной и той же рубрике, потому что рубрики, по которым их оценивают, не пересекаются. Точность формально-логического следования и процент по MMLU-Pro — это не одна и та же единица измерения.
Когда каждый из них — правильное решение
Обращайтесь к TwIL-LM3-Pro, когда нужный вам результат — это машино-проверяемая структура, будь то метка логического следования, утверждение на Lean или семантический разбор, — а рабочая нагрузка пакетная или офлайновая, и лицензия не ограничивает то, что вы делаете с результатом. Его квантованная сборка размером 2,09 ГиБ, работающая на CPU без сетевых зависимостей, — настоящее преимущество для изолированного от сети конвейера или прохода разметки, который должен выполняться на ноутбуке.
Выбирайте Gemma 4 12B, когда вам нужна универсальная модель, которую можно выпускать, когда входные данные не являются текстом, когда контекст длинный или когда требуется дообучение с последующим распространением. Apache 2.0 плюс нативная мультимодальность плюс окно в 256K — это комбинация, которой не предлагает ни один из узкоспециализированных решений.
Эти два подхода также могут сосуществовать. Конвейер, который использует Gemma 4 12B для чтения и нормализации входных данных смешанной модальности, а затем передаёт структурированное утверждение специалисту по формальной логике, представляет собой разумное разделение труда, и это та же схема, что и использование фронтирной модели для составления черновика, а небольшой модели — для проверки.
Обслуживание любого из них с одного эндпоинта
Ни TwIL-LM3-Pro, ни Gemma 4 12B Unified сейчас не являются маршрутом в каталоге OrcaRouter, и об этом стоит сказать до рекомендации, а не после неё. Из того же семейства маршрутизируются более крупные Gemma 4 — `gemma-4-26b-a4b-it` и `gemma-4-31b` — поэтому обычный подход здесь — прототипировать промпт и схему на размещённом уровне Gemma 4 через OpenAI-совместимый эндпоинт по прайс-листовой цене провайдера с добавлением 0% наценки, затем перенести устоявшуюся рабочую нагрузку на чекпойнт 12B на вашем собственном оборудовании. Тот же эндпоинт обслуживает более 200 моделей, поэтому передовая модель, которую вы используете для генерации данных оценки, и небольшая модель, которой вы проверяете её, различаются всего лишь одним ключом и одним форматом запроса, с переключением при сбое, если провайдер начнёт сбоить в середине выполнения.
Это более слабая версия истории о маршрутизации, чем обычно, и её следует подавать именно так: мы не размещаем модель, с которой вы проводите сравнение, поэтому честный совет — это рабочий процесс, а не переключатель.

Решающее правило
Если результат должен быть коммерчески пригодным к развёртыванию, лицензия отвечает на этот вопрос раньше любого бенчмарка, и она указывает на Gemma 4 12B. Если результат — это вывод формальной логики, создаваемый офлайн и потребляемый внутри, TwIL-LM3-Pro — более сильный инструмент при втрое меньшем размере. Если нужно и то и другое, интересная инженерная задача не в том, чтобы выбрать победителя, а в том, чтобы определить интерфейс, где заканчивается общая мультимодальная модель и начинается специалист по формальной логике.


