
TwIL-LM3-Pro:一款透過電子郵件請求即可交付的 3.66B 形式邏輯模型
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
TwIL-LM3-Pro 是 webAI 推出的 3.66 億參數推理模型,專為形式邏輯打造,而非用於一般對話,且自 2026 年 9 月 3 日起便已在 Hugging Face 上架。這並非新發布的版本,而本週圍繞著它流傳的那套說法——webAI「發布了 3.66B 模型」——相較於權重本身已晚了一個月。過去幾天真正改變的事情規模較小,卻也更實用:該檢查點於 9 月 30 日修訂,而 10 月 1 日 webAI 發布了該模型的 LiteRT-LM 版本,供 Android 與 iOS 裝置端推論使用。所以,有趣的問題不是 TwIL-LM3-Pro 是什麼,而是你能否取得它,而答案取決於你站在三條散布管道中的哪一條——因為其中一條是張表單。
這個區別比平常更為重要,因為 TwIL-LM3-Pro 不是一個你直接呼叫就能用的產品。它是一個你得下載、在自己的硬體上執行,並接受禁止商業使用之授權條款的檢查點。它自家模型卡所引導的那項比較——對比參數量多出一倍以上的 Qwen3-8B——確實存在,但那是供應商自行執行的基準測試、在供應商自建的測試框架上所做的比較,而這張模型卡本身在比多數模型卡更多的地方坦承了這一點。本文仔細解讀那張模型卡,並區分出哪些是 webAI 自己測量的結果,哪些是其他任何人所擁有的。
模型實際上是什麼
` block before answering and was evaluated with greedy decoding at a 2,048-token budget." No span markers like {{1}} present. Must preserve code, names. Translate text. Need output only translated text. Traditional Chinese. Need consider "dense Granite decoder" -> 稠密的 Granite 解碼器? "dense" maybe 密集? In model architecture, "dense" means non-MoE: 稠密. "Granite decoder" Granite 解碼器. `GraniteForCausalLM` keep exactly. 40 layers -> 40 層. hidden size 2,560 -> 隱藏大小 2,560. 40 attention heads against 8 key-value heads -> 40 個注意力頭對上 8 個鍵值頭? "against" means versus: 對比 8 個鍵值頭 / 與 8 個鍵值頭. "derived from IBM's `granite-4.2-3b`" -> 衍生自 IBM 的 `granite-4.2-3b`. The 3.66B parameter count is the real total, 3,659,737,600 -> 3.66B 參數量是真正的總數,即 3,659,737,600. context window is base model's 131,072 tokens carried through unchanged -> 上下文視窗是基礎模型原封不動沿用過來的 131,072 個詞元. "tokens" -> 符元? In Taiwan Traditional: 詞元 or 符元. "token" often 權杖? For LLM, 詞元 common. Use 詞元. "It emits a `<think>…</think>` block before answering" -> 它在回答前會發出一個 `<think>…</think>` 區塊. Keep tags exactly. "was evaluated with greedy decoding at a 2,048-token budget" -> 並以 2,048 個詞元的預算使用貪婪解碼進行評估. Need maybe preserve `GraniteForCausalLM` and `granite-4.2-3b` in code ticks. Keep backticks. Preserve `<think>…</think>` exactly incl ellipsis? Use same. Need output only. Let's craft. Potential translation: TwIL-LM3-Pro 是一款稠密的 Granite 解碼器——`GraniteForCausalLM`,40 層,隱藏大小 2,560,40 個注意力頭對上 8 個鍵值頭——衍生自 IBM 的 `granite-4.2-3b`。3.66B 的參數數量是真正的總數,即 3,659,737,600,而上下文視窗則是基礎模型原封不動沿用過來的 131,072 個詞元。它在回答前會發出一個 `<think>…</think>` 區塊,並以 2,048 個詞元的預算、使用貪婪解碼進行評估。 Check "parameter count" maybe "參數量" not "參數數量". "The 3.66B parameter count is the real total" -> 3.66B 的參數量才是真正的總數. Use 才是. "context window is the base model's 131,072 tokens carried through unchanged" -> 上下文視窗是基礎模型的 131,072 個詞元,原封不動沿用。 Good. "40 attention heads against 8 key-value heads" -> 40 個注意力頭對應 8 個鍵值頭? "against" could mean "vs." Maybe 40 個注意力頭對比 8 個鍵值頭. Fine. "TwIL-LM3-Pro" preserve. "Granite" preserve. "dense" = 稠密. In Chinese ML, dense layer = 稠密層. Dense decoder = 稠密解碼器. Good. Need no markers. Final only. Ensure no extra explanation. Maybe "解碼器" in Taiwan: 解碼器. "注意力頭" ok. "鍵值頭" ok. "貪婪解碼" maybe 貪婪解碼. "詞元" ok. "預算" ok. Need use full-width punctuation. Keep em dashes maybe use ——. Good. Final.TwIL-LM3-Pro 是一款稠密的 Granite 解碼器——`GraniteForCausalLM`,40 層,隱藏大小 2,560,40 個注意力頭對上 8 個鍵值頭——衍生自 IBM 的 `granite-4.2-3b`。3.66B 的參數量才是真正的總數,即 3,659,737,600,而上下文視窗則是基礎模型原封不動沿用過來的 131,072 個詞元。它在回答前會發出一個 `<think>…</think>` 區塊,並以 2,048 個詞元的預算、使用貪婪解碼進行評估。
訓練後堆疊是 webAI 真正希望你仔細檢視的部分,而對一個這種規模的模型而言,它的文件記錄異常完整:在合成的形式邏輯語料上進行 rank-64 LoRA 監督式微調、以多重路徑蒸餾為每個提示產生數條推理軌跡、採用參數空間的檢查點融合而非取用最終檢查點、以 α = 0.15 進行 WiSE-FT 插值並透過 TIES 與 DARE-SLERP 合併回預訓練基底,最後是對抗程式化驗證器的熵加權 GRPO 階段——webAI 稱之為 MGPO——訓練至第 2580 步,也就是實際出貨的那個檢查點。
已發布的成品是合併後的策略,而不是 LoRA adapter,這才是實務上的關鍵細節:你可以把它當成獨立模型來執行,以 bf16 格式佔 6.82 GiB,或以 Q4_K_M GGUF 格式佔 2.09 GiB,在 CPU 或 4 GB VRAM 上執行。這就是「可在筆電上執行」的主張,而它是整張說明卡中唯一一個輕易就能驗證、因此值得信任的主張。
Qwen3-8B 的比較,請仔細閱讀
標題 {{1}}webAI puts on the model{{/1}} 是:{{2}}TwIL-LM reaches its own Track A summary rows at 3.66B parameters{{/2}}。這些摘要列分別為:0.5539 的 macro gate、0.2879 的 strict、0.5389 的六線道平均,以及 0.5875 的 macro_primary。對上 Qwen3-8B,macro gate 為 0.5539 對 0.5336——而模型卡本身寫下了行銷頁面會刪掉的那句話:「對 Qwen3-8B 的 gate 領先幅度是 0.020——小於每線道 n = 200 的抽樣雜訊——所以那一項要解讀為持平,而非勝出。」
那是頁面上最重要的一行。webAI 自己對這項頭條結果的表述是:雙方打成平手。而在比較並非平手的地方:
• Strict-7 — TwIL-LM3-Pro 0.2879 對比 Qwen3-8B 0.2093,而且這一列完全沒有採用寬鬆匹配計分,因此不可能靠格式運氣產生。
• 嚴格選擇題 — TwIL-LM3-Pro 0.4100 對比 Qwen3-8B 0.0000,是所報告的十一列中差距最懸殊的一項。
• 規則歸納 — TwIL-LM3-Pro 0.4195 對比 Qwen3-8B 0.3680。
• 語料庫契合度 — 在所有分支中,`lm_corpus` 困惑度最低,為 2.3130,而 Qwen3-8B 則為 2.5478。
• 參數 — 3.66B 對比約 8B,而這正是「參數不到一半」這項說法的全部依據。
那張表附帶兩項但書,而 webAI 兩者都說明了。TwIL-LM3-Pro 的 Track A 生成平均為 1,902 個 token,其中 24.2% 觸及長度上限,相較之下,其自家前代 TwIL-LM3 為 564 個 token;卡片對由此產生差距的說法是「具指示性,而非精確」。此外,表中的吞吐量是在比比較欄位(0.11.2)更晚的 session 中、以更新的 vLLM(0.19.1)測得,因此每秒 token 數的資料列彼此可相互比較,但與其餘部分則僅能約略比較。
在它無法勝出的地方
在留出測試套件上,模型卡直言不諱:「TwIL-LM3-Pro 並未領先。」10 資料集的宏觀平均為 0.7901,與其自身基礎模型的 0.7942 在統計上持平,且遠落後於 Qwen3-8B 的 0.8493 和 gpt-oss-120b 的 0.8689。其 14 資料集的宏觀平均為 0.7425,比其基礎模型高出 0.0093,而這全部的增益都來自 BBH-logic(0.9540 對比基礎模型的 0.9014)——若將該列剔除,該模型在其餘十三項上的平均為 0.726,低於 VibeThinker-3B 的 0.7350。
這個專業化領域內有三個真正的弱點,全都已揭露:FOL 翻譯精確匹配為 0.0100,`procedural` 在嚴格標準下為 0.1200,而語意剖析精確匹配為 0.0000。規則歸納只能剖析其輸出的 56.5%。而且這個模型在設計上就很冗長——每個 Track B 答案約 792 個 token,相較其前代的 482 個——這是成本,不是能力。
這些都不是對這次發布的批評。這正是寫得好的模型卡應有的樣子,也是這裡的數字之所以還能被引用的原因。
有三種方式可以取得,而其中一種是表單
分銷情況才是本週真正的新聞,值得精確說明。
權重放在 Hugging Face 上,未設閘門,依據 webAI Non-Commercial License ver. 1.0 —— 該授權允許研究與個人使用,並要求若部署會產生收益,須與 webAI 另行簽訂協議。這份授權是整個釋出方案的具約束力限制,也是 TwIL-LM3-Pro 為何不是大多數產品團隊能直接採用的模型。
webAI 表示,該系列在一個月內已突破五十萬次下載;這項數字是該公司在自家公告中發布,且未經獨立審計。免費非商業檢查點的下載量,不能作為實際生產使用的替代指標,而 webAI 也並未將其如此呈現。
與此同時,供應商自家的平台並非公開端點。webAI 自稱為企業級平台,能將 AI 帶到你的資料中,並具備本地優先的模型應用;其商業途徑是企業合作安排,而非公開的每 token 計價表。TwIL-LM3-Pro 也未出現在那些收錄開放檢查點的大型第三方推論平台上——我們查過了,它也不在 OrcaRouter 的目錄中——因此,對於「我該從哪裡用 API 呼叫它」這個問題,實際答案是:目前你大多無法這麼做;你得下載它。
第三個管道是新的那個。`TwIL-LM3-Pro-LiteRT-LM` 儲存庫於 2026 年 10 月 1 日出現,帶有 `.litertlm` 構件,並標記支援 Android 與 iOS——那是 webAI 自家以 LiteRT-LM 執行環境封裝的相同權重。那個建置版本是否繼承非商業授權條款,是在圍繞它規劃之前必須先回答的問題,因為父儲存庫正是如此。
為什麼這個規模的形式邏輯專家值得關注
這份發布之所以一再浮上檯面,原因並不是那張基準測試表,而是 webAI 公開了整條流程,在五個不同的基礎模型上跑了完全相同的配方,並把實際結果報告出來。家族比較表記錄了 Track A 巨觀閘門的變動幅度為 +0.012 到 +0.145,視基礎模型而定,而留出測試套件則維持在 ±0.013 之內——這是「這能泛化」一說的書面紀錄版本。每個模型只挑選一個係數,也就是合併權重,並依留出資料的表現進行掃描:SmolLM3 為 0.15,Granite 與 TwIL 基礎模型為 0.20,VibeThinker-3B 則為 0.50。
這是一個可重複使用的方法,能將小型通用模型變成狹窄的專家,而不破壞它原本已知的內容,並且附上負面結果一同發表。對於任何需要蘊含標籤、Lean 陳述形式化或語意剖析,而非流暢散文的人來說,一個可離線執行、沒有每次呼叫費用、也不依賴網路的 2.09 GiB GGUF,與任何託管模型都是截然不同的選擇,無論 Elo 表怎麼說。
未解的問題是,這些權重是否終有一天會以允許商業使用的授權條款釋出,以及 LiteRT-LM 的移植版本是否也附帶同樣的限制。在那之前,TwIL-LM3-Pro 只是一件研究產物,卻有著一張異常誠實的模型卡——而這絕非毫無意義。

如果您現在就需要在正式環境中使用這項功能
就商用部署而言,真正的阻礙在於授權條款,而非基準測試成績,而實際可行的替代方案,是改用一個你可以將請求路由過去的託管模型。這正是 OrcaRouter 所經營的層級:一個與 OpenAI 相容的端點,背後串接 200 多個模型,一律以供應商牌價提供,不加收任何費用,因此供應商一降價,當天就生效,而不必等過一個合約週期。至於小型形式邏輯檢查點真正適用的少數場景——離線批次標註、氣隙環境下的蘊含判定、輸出是標籤而非成篇文字的預處理步驟——最誠實的分工方式,是在工作量屬於「文字轉標籤」時跑本地模型,並把周邊的推理、提示擴充與 QA 交給同一把金鑰下的託管模型。
有一點值得在本節特別重申:有了自動容錯移轉,你甚至可以在還不信任某個模型能用於正式環境路徑之前,就先將流量指向它,而且只要編輯路由規則就能回復,不必重新部署。當某個模型的商業狀態尚未確定時,這正是適合這類模型的作法。

看什麼
三件事會改變這個故事。授權變更,或是明確取得授權的 LiteRT-LM 移植版,會把 TwIL-LM3-Pro 從研究產物推向可部署元件。登上大型託管推論平台,會讓它擁有真正的 API。而獨立評估——由 webAI 以外的任何人來跑 Track A 測試框架——則會告訴我們,它對 Qwen3-8B 的 strict-7 領先優勢,在由非框架打造者進行測量時是否依然成立。這三件事目前都還沒發生,而模型卡夠誠實,讓你能清楚看見它們要產生影響,究竟需要哪些條件成立。

