제목이 'TwIL-LM3-Pro'이고 부제가 '3.66B 형식 논리 모델'인 생성된 타이틀 카드가 있으며, '3.66B 파라미터', '2.09 GiB Q4_K_M', '131,072 토큰 컨텍스트'라고 적힌 둥근 통계 카드 세 장이 있습니다. 하단 줄에는 '벤더 벤치마크: webAI Track A / Track B 하네스.'라고 쓰여 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

TwIL-LM3-Pro: 이메일 요청으로 제공되는 3.66B 형식 논리 모델

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

TwIL-LM3-Pro는 webAI의 36억 6천만 개 매개변수 추론 모델로, 일반 대화보다는 형식 논리를 위해 특별히 만들어졌으며, 2026년 9월 3일부터 Hugging Face에 있었습니다. 이는 새로운 릴리스가 아니며, 이번 주에 그것을 둘러싸고 도는 프레이밍 — 즉 webAI가 “3.66B 모델을 공개했다”는 — 은 가중치 기준으로 한 달 늦은 것입니다. 지난 며칠 동안 실제로 바뀐 것은 더 작고 더 유용합니다: 체크포인트는 9월 30일에 개정되었고, 10월 1일에는 webAI가 온디바이스 Android 및 iOS 추론용 LiteRT-LM 빌드를 공개했습니다. 따라서 흥미로운 질문은 TwIL-LM3-Pro가 무엇인지가 아니라 그것을 얻을 수 있는지이며, 답은 당신이 세 가지 배포 채널 중 어디에 서 있는지에 달려 있습니다 — 그중 하나는 양식이기 때문입니다.

그 차이는 평소보다 더 중요합니다. TwIL-LM3-Pro는 단순히 호출할 수 있는 제품이 아니기 때문입니다. 그것은 직접 다운로드해 자신의 하드웨어에서 실행하고, 상업적 사용을 금지하는 라이선스 조건에 동의해야 하는 체크포인트입니다. 자체 모델 카드가 유도하는 비교 — 두 배가 넘는 매개변수를 가진 Qwen3-8B와의 비교 — 는 실제입니다. 다소 노골적이긴 하지만, 한 벤더 모델 카드가 스스로 대부분보다 더 많은 말로 그렇게 말하고 있습니다.

모델이 실제로 무엇인지

` block before answering and was evaluated with greedy decoding at a 2,048-token budget." No {{}} markers. There are backticks and angle tags. Need preserve URLs and brand/product names. Translate to Korean. Need output only translated text. Need be careful with code backticks maybe keep exact? They said preserve URLs and brand/product names. Product names: TwIL-LM3-Pro, Granite, GraniteForCausalLM, IBM, granite-4.2-3b, maybe <think> tags. Should not translate. We can leave backticked code unchanged. Numbers unchanged. Need Korean natural. "dense Granite decoder" -> "밀집형 Granite 디코더" maybe. "40 layers" -> "40개 층". "hidden size 2,560" -> "은닉 크기 2,560". "40 attention heads against 8 key-value heads" -> "8개 키-값 헤드에 대해 40개 어텐션 헤드" or "40개의 어텐션 헤드와 8개의 키-값 헤드". "derived from IBM's `granite-4.2-3b`" -> "IBM의 `granite-4.2-3b`에서 파생되었습니다." "The 3.66B parameter count is the real total, 3,659,737,600" -> "3.66B 파라미터 수는 실제 총계인 3,659,737,600입니다." "context window is the base model's 131,072 tokens carried through unchanged." -> "컨텍스트 창은 기본 모델의 131,072 토큰으로 변경 없이 유지됩니다." "It emits a `<think>…</think>` block before answering" -> "답변하기 전에 `<think>…</think>` 블록을 출력합니다." "and was evaluated with greedy decoding at a 2,048-token budget." -> "그리고 2,048토큰 예산으로 탐욕적 디코딩(greedy decoding)으로 평가되었습니다." Need maybe "greedy decoding" kept as greedy decoding? Translate? It's a term. "탐욕적 디코딩" maybe okay. "2,048-token budget" -> "2,048토큰 예산". Need no markers. Ensure angle tags preserved exactly: `<think>…</think>` with ellipsis char? Yes. Need maybe "TwIL-LM3-Pro는" etc. "dense" could be "고밀도" but in model architecture "dense" means non-MoE, "dense" often transliterated "덴스". Korean ML: "dense decoder" -> "dense 디코더" or "밀집형 디코더". Better "밀집형 Granite 디코더" because "dense" as opposed to MoE. But preserve product? "Granite" not translate. "TwIL-LM3-Pro는 밀집형 Granite 디코더입니다 — ..." Need decide punctuation. Use em dash as original? Keep em dash maybe. Korean translation can keep em dashes. The user said markers like {{}} none. Output only translated text. Let's craft: "TwIL-LM3-Pro는 밀집형 Granite 디코더입니다 — `GraniteForCausalLM`, 40개 층, 은닉 크기 2,560, 8개 키-값 헤드에 대한 40개 어텐션 헤드 — IBM의 `granite-4.2-3b`에서 파생되었습니다. 3.66B 파라미터 수는 실제 총계인 3,659,737,600이며, 컨텍스트 창은 기본 모델의 131,072 토큰으로 변경 없이 이어집니다. 이 모델은 답변하기 전에 `<think>…</think>` 블록을 출력하며, 2,048토큰 예산에서 greedy decoding으로 평가되었습니다." Check "40 attention heads against 8 key-value heads" maybe "8개 키-값 헤드에 대응하는 40개 어텐션 헤드" or "8개 키-값 헤드 대비 40개 어텐션 헤드". The phrase "against" means 40 query heads vs 8 KV heads. "8개 키-값 헤드에 대해 40개 어텐션 헤드" okay. Maybe "8개 키-값 헤드에 맞선 40개 어텐션 헤드" awkward. "40개의 어텐션 헤드와 8개의 키-값 헤드" simpler. But "against" nuance. "8개 키-값 헤드에 대한 40개 어텐션 헤드" okay. "hidden size" standard "히든 크기" or "은닉 크기". In Korean ML, "hidden size" often "은닉 크기" or "히든 사이즈". Use "은닉 크기". "layers" "층" or "레이어". "40개 레이어" common. "dense Granite decoder" "밀집형 Granite 디코더". "dense decoder" maybe "dense 디코더" brand? No. Could use "고밀도" maybe wrong. In transformer, "dense" means all params active, "밀집형" is acceptable. "carried through unchanged" -> "변경 없이 그대로 유지됩니다" better than "이어집니다". "context window" -> "컨텍스트 창" or "문맥 창". ML uses "컨텍스트 윈도". Use "컨텍스트 창". "base model's" -> "기본 모델의". "carried through unchanged" -> "변경 없이 그대로 이어집니다". Good. "evaluated with greedy decoding at a 2,048-token budget" -> "2,048토큰 예산으로 greedy decoding을 사용해 평가되었습니다." Keep greedy decoding? Could translate "탐욕적 디코딩". The prompt says preserve brand/product names; greedy decoding is term, can translate. To be safe, "탐욕적 디코딩(greedy decoding)" maybe. But output only translated text; adding parentheses okay. But maybe user expects Korean. Use "탐욕적 디코딩" maybe enough. However "greedy decoding" widely used as "그리디 디코딩". Korean ML often "그리디 디코딩". Let's use "그리디 디코딩". "at a 2,048-token budget" -> "2,048토큰 예산으로". "was evaluated" -> "평가되었습니다." Need no markers. Ensure backticks exactly. The original has backticks around GraniteForCausalLM, granite-4.2-3b, <think>…</think>. Keep. "IBM's" -> "IBM의". Good. Potential issue: "TwIL-LM3-Pro is a dense Granite decoder" maybe "TwIL-LM3-Pro는 밀집형 Granite 디코더입니다" yes. Let's final. Ensure no extra quotes. Final Korean: "TwIL-LM3-Pro는 밀집형 Granite 디코더입니다 — `GraniteForCausalLM`, 40개 층, 은닉 크기 2,560, 8개 키-값 헤드에 대한 40개 어텐션 헤드 — IBM의 `granite-4.2-3b`에서 파생되었습니다. 3.66B 파라미터 수는 실제 총계인 3,659,737,600이며, 컨텍스트 창은 기본 모델의 131,072 토큰으로 변경 없이 그대로 이어집니다. 이 모델은 답변하기 전에 `<think>…</think>` 블록을 출력하며, 2,048토큰 예산으로 그리디 디코딩을 통해 평가되었습니다." Check "hidden size 2,560" -> "은닉 크기 2,560" okay. "40 attention heads against 8 key-value heads" -> "8개 키-값 헤드에 대한 40개 어텐션 헤드" okay. "the real total, 3,659,737,600" -> "실제 총계인 3,659,737,600" okay. "carried through unchanged" -> "변경 없이 그대로 이어집니다" okay. "emits" -> "출력하며" okay. "with greedy decoding at a 2,048-token budget" -> "2,048토큰 예산으로 그리디 디코딩을 통해 평가되었습니다." Good. Need output only. TwIL-LM3-Pro는 밀집형 Granite 디코더입니다 — `GraniteForCausalLM`, 40개 층, 은닉 크기 2,560, 8개 키-값 헤드에 대한 40개 어텐션 헤드 — IBM의 `granite-4.2-3b`에서 파생되었습니다. 3.66B 파라미터 수는 실제 총계인 3,659,737,600이며, 컨텍스트 창은 기본 모델의 131,072 토큰으로 변경 없이 그대로 이어집니다. 이 모델은 답변하기 전에 `<think>…</think>` 블록을 출력하며, 2,048토큰 예산으로 그리디 디코딩을 통해 평가되었습니다.

포스트트레이닝 스택은 webAI가 실제로 여러분이 들여다보기를 바라는 부분이며, 이 정도 크기의 모델치고는 이례적으로 잘 문서화되어 있다: 합성 형식 논리 말뭉치에 대한 rank-64 LoRA 지도 미세조정, 프롬프트마다 여러 개의 추론 트레이스를 생성하는 다중 경로 증류, 최종 체크포인트를 택하는 대신 파라미터 공간 체크포인트 융합, TIES와 DARE-SLERP로 사전학습 베이스 쪽으로 다시 병합하는 α = 0.15의 WiSE-FT 보간, 그리고 마지막으로 프로그래매틱 검증기에 대항한 엔트로피 가중 GRPO 단계 — webAI는 이를 MGPO라고 부른다 — 를 스텝 2580까지 실행했으며, 이것이 실제로 배포된 체크포인트다.

공개된 아티팩트는 LoRA 어댑터가 아니라 병합된 정책이며, 이는 실용적인 세부 사항이다: 단독 모델로, bf16으로 6.82 GiB에서, 또는 CPU나 4 GB VRAM에서 2.09 GiB의 Q4_K_M GGUF로 실행할 수 있다. 그것이 바로 "노트북에서 실행된다"는 주장이고, 모델 카드 전체에서 손쉽게 검증할 수 있어 따라서 신뢰할 가치가 있는 유일한 주장이다.

Qwen3-8B 비교, 주의 깊게 읽어 보세요.

webAI가 이 모델에 붙이는 헤드라인은 TwIL-LM3-Pro가 3.66B 파라미터로 자체 Track A 요약 행의 최상단에 도달한다는 것이다. 네 개의 요약 행은 매크로 게이트 0.5539, strict-7 0.2879, 6레인 평균 0.5389, macro_primary 0.5875이다. Qwen3-8B와 비교하면 매크로 게이트는 0.5539 대 0.5336이며, 모델 카드 자체에는 마케팅 페이지라면 삭제했을 문장이 적혀 있다: "Qwen3-8B에 대한 게이트 우위는 0.020 — 레인당 n = 200에서의 샘플링 노이즈보다 작다 — 그러니 그것은 승리가 아니라 동등으로 읽어야 한다."

그것은 이 페이지에서 단연 가장 중요한 한 줄입니다. webAI가 헤드라인 결과를 스스로 규정한 방식은 그것이 무승부라는 것입니다. 비교가 무승부가 아닌 부분:

• Strict-7 — TwIL-LM3-Pro 0.2879 vs Qwen3-8B 0.2093, 그리고 이 행은 어디에서도 느슨한 일치(loose-match) 점수를 사용하지 않으므로 서식상의 요행으로 만들어질 수 없습니다.

• 엄격한 MCQ — TwIL-LM3-Pro 0.4100 vs Qwen3-8B 0.0000, 보고된 11개 행 중 가장 큰 레인 격차.

• 규칙 유도 — TwIL-LM3-Pro 0.4195 vs Qwen3-8B 0.3680.

• 코퍼스 적합도 — 모든 실험군 중 가장 낮은 `lm_corpus` 퍼플렉서티 2.3130, Qwen3-8B는 2.5478.

• 파라미터 — 3.66B 대 약 8B, 이는 "파라미터가 절반도 안 된다"는 주장의 전적인 근거이다.

그 표에는 두 가지 주의사항이 따라붙으며, webAI는 둘 다 명시한다. TwIL-LM3-Pro의 트랙 A 생성 결과는 평균 1,902토큰이고 그중 24.2%가 길이 상한에 도달한 반면, 자체 전작인 TwIL-LM3는 564토큰이었다. 이로 인해 생긴 차이에 대해 카드가 쓰는 표현은 "정확한 수치라기보다는 참고 지표"라는 것이다. 그리고 표의 처리량 수치는 비교 열(0.11.2)보다 더 최신 vLLM(0.19.1)에서 이후 세션에 측정되었으므로, 초당 토큰 행들은 서로 비교할 수 있고 나머지와는 대략적으로만 비교할 수 있다.

그것이 이기지 못하는 곳

홀드아웃 스위트에서 모델 카드는 단호하다: "TwIL-LM3-Pro는 이를 앞서지 못한다." 10개 데이터셋 매크로는 0.7901로, 자체 베이스 모델의 0.7942와 통계적으로 동일한 수준이며, Qwen3-8B의 0.8493과 gpt-oss-120b의 0.8689에는 크게 뒤진다. 14개 데이터셋 매크로 0.7425는 베이스보다 0.0093 높으며, 그 상승분 전체가 BBH-logic(베이스의 0.9013 대비 0.9540)에서 나온다. 그 한 행을 빼면 이 모델은 나머지 열세 개에서 평균 0.7263으로, VibeThinker-3B의 0.7350보다 낮다.

특화 영역 내부에는 실질적으로 취약한 지점이 세 가지 있으며, 모두 공개되어 있다: FOL 번역 정확 일치 0.0100, 엄격 기준 `procedural` 0.1200, 의미 구문 분석 정확 일치 0.0000. 규칙 귀납은 자신의 출력 중 56.5%만 파싱한다. 그리고 이 모델은 구조적으로 장황하다 — Track B 답변당 약 792토큰으로, 이전 모델의 482토큰과 대비되는데 — 이는 역량이 아니라 비용이다.

이 중 어느 것도 이번 릴리스에 대한 비판이 아닙니다. 이것은 잘 작성된 모델 카드의 모습이며, 여기 수치들을 인용할 수 있는 이유이기도 합니다.

그것을 얻는 세 가지 방법이 있고, 그중 하나는 양식입니다.

유통 상황이 이번 주의 실제 뉴스이며, 이를 정확히 언급할 가치가 있다.

가중치는 Hugging Face에 접근 제한 없이 공개되어 있으며, webAI Non-Commercial License ver. 1.0에 따라 제공됩니다. 이 라이선스는 연구 및 개인적 사용을 허용하고, 수익을 창출하는 배포에는 webAI와의 별도 계약을 요구합니다. 그 라이선스는 이번 전체 릴리스에 대한 구속력 있는 제약 조건이며, TwIL-LM3-Pro가 대부분의 제품 팀이 단순히 채택할 수 있는 모델이 아닌 이유이기도 합니다.

webAI는 해당 패밀리가 한 달 만에 다운로드 50만 건을 넘어섰다고 밝혔는데, 이 수치는 회사가 자체 발표에서 공개한 것으로 독립적인 감사를 거치지 않았다. 무료 비상업용 체크포인트의 다운로드 수는 프로덕션 사용의 대리 지표가 아니며, webAI도 이를 그런 지표로 제시하지 않는다.

한편, 공급업체 자체 플랫폼은 공개 엔드포인트가 아닙니다. webAI는 로컬 우선 모델 애플리케이션을 갖춘, AI를 귀하의 데이터로 가져오는 엔터프라이즈 플랫폼이라고 자체 설명하며, 그 상용화 경로는 공개된 토큰당 요금표라기보다 엔터프라이즈 계약 방식입니다. TwIL-LM3-Pro는 오픈 체크포인트를 색인하는 대형 서드파티 추론 플랫폼에도 없습니다 — 확인해 보니 OrcaRouter 카탈로그에도 없습니다 — 따라서 "API에서 이걸 어디에서 호출하나요?"에 대한 실질적인 답은, 현재로서는 대부분 호출할 곳이 없다는 것입니다. 그냥 다운로드하는 겁니다.

세 번째 채널은 새로 생긴 채널입니다. `TwIL-LM3-Pro-LiteRT-LM` 저장소는 2026년 10월 1일에 등장했으며, `.litertlm` 아티팩트를 담고 있고 Android 및 iOS용으로 태그가 지정되었습니다 — 동일한 가중치를 webAI 자체의 LiteRT-LM 런타임으로 패키징한 것입니다. 그 빌드가 비상업적 라이선스를 상속하는지 여부는 그것을 전제로 계획하기 전에 답해야 할 질문입니다. 상위 저장소가 그 라이선스를 상속하기 때문입니다.

이 규모에서 형식논리 전문가가 주목할 만한 이유

이 릴리스가 계속 다시 떠오르는 이유는 벤치마크 표 때문이 아니다. webAI가 전체 파이프라인을 공개하고, 다섯 개의 서로 다른 베이스 모델에 동일한 레시피를 실행하고, 무슨 일이 일어났는지 보고했기 때문이다. 패밀리 비교 표는 베이스에 따라 +0.012에서 +0.145까지의 Track A 매크로 게이트 이동을 기록하며, 홀드아웃 스위트는 ±0.013 이내를 유지한다 — "이것은 일반화된다"의 종이 흔적 버전이다. 모델당 선택되는 하나의 계수는 병합 가중치이며, 홀드아웃 성능에 따라 스윕되었다: SmolLM3의 경우 0.15, Granite와 TwIL 베이스의 경우 0.20, VibeThinker-3B의 경우 0.50.

그것은 작은 범용 모델을 이미 알고 있던 것을 파괴하지 않으면서 좁은 분야의 전문가로 바꾸기 위한 재사용 가능한 레시피이며, 부정적 결과까지 함께 공개된 것이다. 유창한 산문이 아니라 함의 레이블, Lean 문장 형식화, 또는 의미 파싱이 필요한 사람에게는, 호출당 비용도 네트워크 의존성도 없이 오프라인으로 실행되는 2.09 GiB GGUF가 Elo 표가 뭐라고 하든 어떤 호스팅 모델과도 다른 선택지다.

열린 문제는 가중치가 상업적 사용을 허용하는 라이선스로 언젠가 공개될지, 그리고 LiteRT-LM 포트도 같은 제한을 달고 배포될지 여부다. 그때까지 TwIL-LM3-Pro는 유난히 정직한 모델 카드를 갖춘 연구 산출물이다 — 그것도 아무것도 아닌 것은 아니다.

A generated single-column scoreboard headed 'TwIL-LM3-Pro - the scoreboard' with six rows: Macro gate 0.5539; Strict-7 0.2879; Strict MCQ 0.4100; Rule induction 0.4195; Held-out 10-set macro 0.7901; Parameters 3.66B dense. A footer line reads 'All figures vendor-reported by webAI; no independent evaluation yet.' The OrcaRouter logo is composited in the bottom-right corner.

오늘 프로덕션 환경에서 이 기능이 필요하다면

상용 배포에서는 벤치마크보다 라이선스가 걸림돌이며, 실질적인 대안은 라우팅할 수 있는 호스팅 모델입니다. 그것이 바로 OrcaRouter가 운영하는 계층입니다: 200개 이상의 모델 앞에 놓인 하나의 OpenAI 호환 엔드포인트를 공급자 정가에 마크업 없이 제공, 따라서 공급업체의 가격 인하가 계약 주기를 거친 뒤가 아니라 같은 날 바로 반영됩니다. 소규모 형식 논리 체크포인트가 정말로 적합한 몇몇 경우 — 오프라인 배치 라벨링, 에어갭 환경의 함의 패스, 출력이 산문이 아니라 라벨인 전처리 단계 — 에서는 정직한 분담은 워크로드가 텍스트-투-라벨인 곳에서는 로컬 모델을 실행하고, 주변의 추론, 프롬프트 확장, QA는 같은 키로 호스팅 모델에 라우팅하는 것입니다.

이 섹션에서 특히 다시 강조할 만한 주의점이 하나 있습니다: 자동 장애 조치를 사용하면 프로덕션 경로에서 신뢰하기 전에도 모델을 가리킬 수 있고, 재배포 대신 라우팅 규칙을 편집해 롤백할 수 있습니다. 이것이 상용 상태가 확정되지 않은 이런 모델에 맞는 패턴입니다.

A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the tags for Text Generation, Transformers, Safetensors, GGUF, English, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.

볼 만한 것

세 가지가 이 이야기를 바꿀 것입니다. 라이선스 변경, 또는 명확히 라이선스가 부여된 LiteRT-LM 포팅은 TwIL-LM3-Pro를 연구용 아티팩트에서 배포 가능한 컴포넌트로 옮겨 놓을 것입니다. 주요 호스팅 추론 플랫폼에 등장하면 실제 API를 갖게 될 것입니다. 그리고 독립적인 평가, 즉 webAI가 아닌 누군가가 Track A 하니스를 실행하는 것은 Qwen3-8B에 대한 strict-7 우위가 하니스를 만들지 않은 사람이 측정해도 유지되는지 알려줄 것입니다. 세 가지 중 어느 것도 아직 일어나지 않았고, 모델 카드는 이것들이 중요해지려면 무엇이 성립해야 하는지 정확히 알 수 있을 만큼 정직합니다.

A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro-LiteRT-LM, created 1 October 2026, showing the tags TextGeneration, LiteRT-LM, on-device, android, ios, granite, granite-4.2 and reasoning, and the card text describing TwIL-LM3-Pro converted to Google's LiteRT-LM (.litertlm) format for on-device inference, requiring LiteRT-LM 0.16 or newer, preserving the ChatML prompt format and pre-opening the think block.