Сгенерированная титульная карточка с заголовком «TwIL-LM3-Pro» и подзаголовком «Формально-логическая модель на 3,66 млрд параметров», с тремя скруглёнными карточками статистики: «3,66 млрд параметров», «2,09 GiB Q4_K_M» и «контекст на 131 072 токена». В нижней строке указано: «Вендорные бенчмарки: испытательный стенд webAI Track A / Track B». Логотип OrcaRouter скомпонован в правом нижнем углу.
Guides & Insights

TwIL-LM3-Pro: формально-логическая модель на 3,66 млрд параметров, доступная по запросу по электронной почте

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

TwIL-LM3-Pro — это модель рассуждений с 3,66 млрд параметров от webAI, созданная специально для формальной логики, а не для обычных разговоров, и она находится на Hugging Face с 3 сентября 2026 года. Это не новый релиз, и трактовка, циркулирующая вокруг неё на этой неделе — будто webAI «выпустила модель на 3,66 млрд параметров» — на месяц опаздывает относительно самих весов. Что действительно изменилось за последние несколько дней, так это меньшее и более полезное: чекпойнт был пересмотрен 30 сентября, а 1 октября webAI опубликовала сборку модели на LiteRT-LM для вывода на устройстве под Android и iOS. Так что интересный вопрос не в том, что такое TwIL-LM3-Pro, а в том, можете ли вы её получить, и ответ зависит от того, в каком из трёх каналов распространения вы находитесь — потому что один из них — это форма.

Это различие значит больше, чем обычно, потому что TwIL-LM3-Pro — не продукт, который можно просто вызвать. Это чекпоинт, который вы скачиваете, запускаете на собственном оборудовании и принимаете условия лицензии, запрещающей коммерческое использование. Сравнение, которое предлагает его собственная карточка модели — с Qwen3-8B, моделью с более чем вдвое большим числом параметров — реально, но это сравнение бенчмарков, запущенных вендором, на построенном вендором стенде, и сама карточка модели говорит об этом в большем числе мест, чем большинство. В этом материале мы внимательно разбираем эту карточку и отделяем то, что измерила webAI, от того, что есть у кого-либо ещё.

Что модель на самом деле есть

` block before answering and was evaluated with greedy decoding at a 2,048-token budget." No {{}} markers. Need output only translated text. Preserve URLs and brand/product names. Also backtick code? Preserve exact code identifiers? Probably keep `GraniteForCausalLM`, `granite-4.2-3b`, `<think>…</think>` as is. Translate surrounding. Need Russian. Ensure numbers: 2,560 (could be 2560 in Russian? Usually decimal separator comma for thousands? Russian uses space as thousands separator, comma decimal. But product specs maybe keep "2 560" or "2,560"? To preserve exact? User didn't specify number formatting, only markers. We can use "2 560" Russian style. But hidden size 2,560: In Russian technical often "2 560". Parameter count 3.66B -> 3,66 млрд, 3,659,737,600 -> 3 659 737 600. Context window 131,072 -> 131 072. 2,048 -> 2 048. But maybe exact numbers need preserve? Could keep commas to avoid ambiguity? Translation to Russian typically uses spaces. The instruction: preserve URLs and brand/product names. Numbers can be localized. I'll localize with non-breaking spaces? Output plain spaces. Maybe "2 560". "3,66 млрд", "3 659 737 600", "131 072", "2 048". Need be careful with terms: dense Granite decoder — плотный декодер Granite? "Granite decoder" maybe "декодер Granite". GraniteForCausalLM is code class, keep. 40 layers = 40 слоёв, hidden size = размер скрытого слоя / скрытая размерность? "hidden size 2,560" = размер скрытого представления 2 560. 40 attention heads against 8 key-value heads = 40 голов внимания против 8 голов ключей-значений? "attention heads" = головы внимания; "key-value heads" = головы ключ-значение / key-value heads. In Russian ML, "головы внимания" and "головы ключ-значение". "against" = при / против. "при 8 головах ключ-значение". Derived from IBM's `granite-4.2-3b` = создана на основе `granite-4.2-3b` от IBM. The 3.66B parameter count is the real total, 3,659,737,600, and the context window is the base model's 131,072 tokens carried through unchanged. = Количество параметров 3,66 млрд — это реальный общий объём, 3 659 737 600; окно контекста — 131 072 токена базовой модели, перенесённые без изменений. It emits a `<think>…</think>` block before answering and was evaluated with greedy decoding at a 2,048-token budget. = Перед ответом он выдаёт блок `<think>…</think>`; оценка проводилась с жадным декодированием при бюджете в 2 048 токенов. "greedy decoding" = жадное декодирование. "at a 2,048-token budget" = с бюджетом 2 048 токенов. Need preserve `<think>…</think>` exactly, including ellipsis char. Backticks around code identifiers preserve. Should we keep "TwIL-LM3-Pro" exact. "IBM's" IBM. "Granite" brand. "dense" maybe "плотный". "Granite decoder" maybe "декодер Granite" or "плотный декодер Granite". "dense" in architecture = плотный. Use "плотный декодер Granite". Potential issue: Russian translation should not use em dash incorrectly? Fine. No markers. Output only translated text. Ensure no preamble. Let's craft: TwIL-LM3-Pro — это плотный декодер Granite (`GraniteForCausalLM`): 40 слоёв, размер скрытого слоя 2 560, 40 голов внимания при 8 головах ключ-значение, созданный на основе `granite-4.2-3b` от IBM. Количество параметров 3,66 млрд — это реальный общий итог, 3 659 737 600; окно контекста составляет 131 072 токена базовой модели и перенесено без изменений. Перед ответом он выдаёт блок `<think>…</think>`, а оценка проводилась с жадным декодированием при бюджете в 2 048 токенов. Check "40 attention heads against 8 key-value heads" maybe "40 голов внимания против 8 голов ключ-значение". "при" is fine. "derived from IBM's `granite-4.2-3b`" -> "произведён на основе ..."? "созданный на основе" refers to decoder. Fine. "3.66B" translate as "3,66 млрд" (Russian decimal comma). "3,659,737,600" -> "3 659 737 600". Good. But if they expect exact comma separators? In Russian, space. The instruction preserve URLs and brand names, not numbers. Fine. Could use non-breaking spaces? Not necessary. "131,072 tokens" -> "131 072 токена" correct Russian genitive singular? 131,072 ends in 2, but Russian for 131072: "131 072 токена" because last two digits 72 -> 72 ends with 2, so "токена". Yes. 2,048 tokens -> 2 048 токенов (ends 48 -> ов). Good. 40 слоёв. 40 голов. 8 головах. 3,66 млрд — "миллиарда"? 3,66 — decimal, noun genitive singular: "3,66 млрд" abbreviation no issue. "3,66 миллиарда" maybe. Keep "3,66 млрд". Good. Need ensure all code spans preserved exact. In translation I wrote `GraniteForCausalLM` with parentheses instead of em dash? Original: "TwIL-LM3-Pro is a dense Granite decoder — `GraniteForCausalLM`, 40 layers..." Could translate with colon? It's okay but maybe should preserve structure: "TwIL-LM3-Pro — это плотный декодер Granite — `GraniteForCausalLM`, 40 слоёв..." That mirrors em dash. Use that. Then "созданный на основе" maybe after parenthetical. Original has "— derived from ..." after key-value heads. Let's follow: "TwIL-LM3-Pro — это плотный декодер Granite — `GraniteForCausalLM`, 40 слоёв, размер скрытого слоя 2 560, 40 голов внимания против 8 голов ключ-значение, — созданный на основе `granite-4.2-3b` от IBM." Hmm double dash awkward. Better: "TwIL-LM3-Pro — это плотный декодер Granite (`GraniteForCausalLM`): 40 слоёв, размер скрытого слоя 2 560, 40 голов внимания против 8 голов ключ-значение; он создан на основе `granite-4.2-3b` от IBM." This is natural. It moves "derived from" not marker issue. Good. No markers. Output only translated. Potential hidden requirement: The text contains numbered span markers like {{1}}... but here none. So just translate. Need final only translated text. Ensure no markdown quotes.TwIL-LM3-Pro — это плотный декодер Granite (`GraniteForCausalLM`): 40 слоёв, размер скрытого слоя 2 560, 40 голов внимания против 8 голов ключ-значение; он создан на основе `granite-4.2-3b` от IBM. Количество параметров 3,66 млрд — это реальный общий итог, 3 659 737 600; окно контекста составляет 131 072 токена базовой модели и перенесено без изменений. Перед ответом он выдаёт блок `<think>…</think>`, а оценка проводилась с жадным декодированием при бюджете в 2 048 токенов.

Стек постобучения — это та часть, на которую webAI на самом деле хочет, чтобы вы обратили внимание, и для модели такого размера он задокументирован на удивление хорошо: контролируемое дообучение LoRA ранга 64 на синтетическом корпусе формальной логики, многопутевая дистилляция для получения нескольких цепочек рассуждений на каждый промпт, слияние чекпойнтов в пространстве параметров вместо взятия финального чекпойнта, интерполяция WiSE-FT при α = 0.15, слитая обратно с предобученной базой с помощью TIES и DARE-SLERP, и наконец этап GRPO со взвешиванием по энтропии — webAI называет его MGPO — против программного верификатора, выполненный до шага 2580, который и является выпущенным чекпойнтом.

Опубликованный артефакт — это объединённая политика, а не адаптер LoRA, и в этом заключается практическая деталь: его можно запустить как самостоятельную модель в bf16 при 6.82 GiB или как Q4_K_M GGUF при 2.09 GiB на CPU или 4 ГБ видеопамяти. Именно в этом состоит утверждение «работает на ноутбуке», и это единственное утверждение во всей карточке, которое тривиально проверяемо и потому заслуживает доверия.

Сравнение Qwen3-8B, читайте внимательно

Заголовок, который webAI помещает на модель, таков: TwIL-LM3-Pro возглавляет собственные сводные строки Track A при 3,66 млрд параметров. Четыре сводные строки — это macro gate 0,5539, strict-7 0,2879, среднее по шести дорожкам 0,5389 и macro_primary 0,5875. В сравнении с Qwen3-8B macro gate равен 0,5539 против 0,5336 — и сама карточка модели содержит предложение, которое маркетинговая страница удалила бы: «преимущество по gate над Qwen3-8B равно 0,020 — меньше шума выборки при n = 200 на дорожку — поэтому считайте это паритетом, а не победой».

Это самая важная строка на странице. Собственная формулировка webAI относительно главного результата состоит в том, что это ничья. Там, где сравнение не является ничьей:

• Strict-7 — TwIL-LM3-Pro 0.2879 против Qwen3-8B 0.2093, и в этой строке нигде не используется зачёт за нестрогое совпадение, поэтому её нельзя получить благодаря удаче в форматировании.

• Строгий MCQ — TwIL-LM3-Pro 0.4100 против Qwen3-8B 0.0000, самый широкий разрыв по дорожке среди одиннадцати представленных строк.

• Индукция правил — TwIL-LM3-Pro 0.4195 против Qwen3-8B 0.3680.

• Соответствие корпусу — самая низкая перплексия `lm_corpus` среди всех вариантов — 2.3130, тогда как у Qwen3-8B — 2.5478.

• Параметры — 3,66 млрд против примерно 8 млрд, что и является всей основой для утверждения «меньше половины параметров».

С этой таблицей связаны две оговорки, и webAI указывает обе. Генерации Track A от TwIL-LM3-Pro в среднем составляют 1 902 токена, и 24,2% из них достигают ограничения длины, против 564 токенов у его собственного предшественника TwIL-LM3; в карточке получившийся разрыв назван «ориентировочным, а не точным». А показатели пропускной способности в таблице были измерены в более позднем сеансе на более новой версии vLLM (0.19.1), чем столбцы для сравнения (0.11.2), поэтому строки с токенами в секунду сопоставимы друг с другом и лишь приблизительно — с остальными.

Где это не побеждает

На отложенном наборе карточка модели прямо заявляет: «TwIL-LM3-Pro не лидирует на нём». Макропоказатель по 10 наборам данных составляет 0.7901, статистически на одном уровне с её собственной базовой моделью на 0.7942, и значительно уступает Qwen3-8B с 0.8493 и gpt-oss-120b с 0.8689. Её макропоказатель по 14 наборам данных, равный 0.7425, превосходит базовую модель на 0.0093, и весь этот прирост обеспечивается BBH-logic (0.9540 против 0.9013 у базовой модели) — если исключить эту одну строку, модель в среднем показывает 0.7263 по оставшимся тринадцати, что ниже, чем 0.7350 у VibeThinker-3B.

Внутри специализации есть три действительно слабых места, и все они раскрыты: точное совпадение перевода FOL на уровне 0.0100, `procedural` — 0.1200 при строгой оценке и точное совпадение семантического разбора на уровне 0.0000. Индукция правил разбирает лишь 56,5% своих выходных данных. А модель многословна по своей конструкции — около 792 токенов на ответ Track B против 482 у предшественника, — и это издержка, а не возможность.

Ничто из этого не является критикой релиза. Именно так выглядит хорошо написанная карточка модели, и именно поэтому приведённые здесь числа вообще можно цитировать.

Три способа получить это, и один из них — форма

Ситуация с распространением — это и есть настоящая новость недели, и её стоит изложить точно.

Веса опубликованы на Hugging Face без ограничений доступа, под лицензией webAI Non-Commercial License ver. 1.0 — она разрешает исследовательское и личное использование и требует отдельного соглашения с webAI для развёртывания с целью получения дохода. Эта лицензия — жёсткое ограничение для всего релиза, и именно поэтому TwIL-LM3-Pro — не та модель, которую большинство продуктовых команд может просто взять и внедрить.

webAI сообщает, что семейство превысило полмиллиона загрузок за месяц, — цифра, которую компания опубликовала в своём собственном анонсе и которая не была независимо проверена. Загрузки бесплатного некоммерческого чекпоинта не являются косвенным показателем промышленного использования, и webAI не представляет их таковым.

Собственная платформа вендора, тем временем, не является публичным эндпоинтом. webAI описывает себя как корпоративную платформу, которая привносит ИИ в ваши данные, с приложением модели, ориентированным в первую очередь на локальную работу, а коммерческий путь у неё — корпоративная схема, а не опубликованный прайс-лист с оплатой за токены. TwIL-LM3-Pro также отсутствует на крупных сторонних платформах инференса, которые индексируют открытые чекпойнты — мы проверяли, и в каталоге OrcaRouter его тоже нет — так что практический ответ на вопрос «откуда мне вызывать это через API» таков: прямо сейчас по большей части вы этого не делаете; вы его скачиваете.

Третий канал — новый. Репозиторий `TwIL-LM3-Pro-LiteRT-LM` появился 1 октября 2026 года с артефактами `.litertlm` и тегами для Android и iOS — собственная упаковка среды выполнения LiteRT-LM от webAI для тех же весов. Наследует ли эта сборка некоммерческую лицензию — вот вопрос, на который нужно ответить, прежде чем планировать с учётом неё, поскольку родительский репозиторий её наследует.

Почему за специалистом по формальной логике такого масштаба стоит следить

Причина, по которой этот релиз снова и снова всплывает, не в таблице бенчмарков. Дело в том, что webAI опубликовала весь пайплайн, прогнала идентичный рецепт на пяти разных базовых моделях и сообщила, что из этого вышло. Таблица сравнения семейства фиксирует изменение макро-гейта Track A от +0,012 до +0,145 в зависимости от базовой модели, при этом отложенный набор остаётся в пределах ±0,013 — документально подтверждённая версия утверждения «это обобщается». Единственный коэффициент, выбираемый для каждой модели, — это вес слияния, подбираемый по производительности на отложенном наборе: 0,15 для SmolLM3, 0,20 для Granite и базовой модели TwIL, 0,50 для VibeThinker-3B.

Это многоразовый рецепт превращения небольшой универсальной модели в узкого специалиста без разрушения того, что она уже знала, опубликованный вместе с приложенными отрицательными результатами. Для любого, кому нужны метки логического следования, формализация утверждений в Lean или семантические разборы, а не гладкий связный текст, GGUF размером 2,09 ГиБ, работающий офлайн без платы за вызов и без зависимости от сети, — это совсем другое дело по сравнению с любой хостинговой моделью, что бы ни говорила таблица Elo.

Открытым остаётся вопрос, появятся ли когда-нибудь веса под лицензией, допускающей коммерческое использование, и будет ли порт LiteRT-LM поставляться с тем же ограничением. До тех пор TwIL-LM3-Pro — исследовательский артефакт с необычайно честной карточкой модели, и это уже кое-что.

A generated single-column scoreboard headed 'TwIL-LM3-Pro - the scoreboard' with six rows: Macro gate 0.5539; Strict-7 0.2879; Strict MCQ 0.4100; Rule induction 0.4195; Held-out 10-set macro 0.7901; Parameters 3.66B dense. A footer line reads 'All figures vendor-reported by webAI; no independent evaluation yet.' The OrcaRouter logo is composited in the bottom-right corner.

Если вам нужна эта возможность в продакшене уже сегодня

Для коммерческого развёртывания камнем преткновения становится лицензия, а не результаты бенчмарков, и практичная замена — это хостируемая модель, к которой можно маршрутизировать запросы. Именно на этом уровне работает OrcaRouter: одна конечная точка, совместимая с OpenAI, перед более чем 200 моделями по каталожным ценам провайдеров, без каких-либо наценок, так что снижение цены поставщиком вступает в силу в тот же день, а не после очередного договорного цикла. Для тех немногих случаев, где небольшая модель формальной логики действительно уместна — офлайн-пакетная разметка, проход вывода в изолированном контуре, этап предобработки, результат которого — метка, а не связный текст, — честное разделение состоит в том, чтобы запускать локальную модель там, где задача сводится к «текст → метка», а сопутствующие рассуждения, расширение промптов и контроль качества направлять на хостируемые модели с тем же ключом.

Одна оговорка, которую стоит повторить именно в этом разделе: благодаря автоматическому переключению при сбое вы можете также направить трафик на модель, прежде чем доверите её на производственном пути, и откатиться, отредактировав правило маршрутизации, а не выполняя повторное развёртывание. Именно этот подход подходит для такой модели, когда её коммерческий статус не определён.

A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the tags for Text Generation, Transformers, Safetensors, GGUF, English, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.

Что посмотреть

Три вещи изменили бы эту историю. Смена лицензии — или явно лицензированный порт LiteRT-LM — перевела бы TwIL-LM3-Pro из исследовательского артефакта в компонент, пригодный для развёртывания. Появление на крупной хостинговой платформе инференса дало бы ему настоящий API. А независимая оценка — если бы кто-то, кроме webAI, запустил тестовый стенд Track A — сказала бы нам, сохраняется ли преимущество strict-7 над Qwen3-8B, когда его измеряет тот, кто не создавал этот стенд. Ни одно из трёх ещё не произошло, и карточка модели достаточно честна, чтобы можно было точно увидеть, что должно было бы выполняться, чтобы они имели значение.

A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro-LiteRT-LM, created 1 October 2026, showing the tags TextGeneration, LiteRT-LM, on-device, android, ios, granite, granite-4.2 and reasoning, and the card text describing TwIL-LM3-Pro converted to Google's LiteRT-LM (.litertlm) format for on-device inference, requiring LiteRT-LM 0.16 or newer, preserving the ChatML prompt format and pre-opening the think block.