一張生成的標題卡,標題為「TwIL-LM3-Pro vs Gemma 4 12B」,副標題為「兩個本地模型,兩種授權」,並有兩張圓角卡片,分別寫著「TwIL-LM3-Pro - 非商業」與「Gemma 4 12B - Apache 2.0」。頁腳一行寫著「授權比任何基準測試列更能決定部署數量。」OrcaRouter 標誌合成於右下角。
Guides & Insights

TwIL-LM3-Pro 對比 Gemma 4 12B:兩個除了筆電之外毫無共同點的本機模型

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

將TwIL-LM3-Pro與Gemma 4 12B並排比較,相似之處確實存在,卻很表面:兩者都是你今天就能下載的開放權重檢查點,都能在消費級硬體上執行,無需雲端帳號,也都能離線回答問題。除此之外,兩者便分道揚鑣,而最尖銳的分歧在於法律,而非技術。TwIL-LM3-Pro 是 webAI 的 3.66B 形式邏輯專門模型,以 webAI 非商業授權條款第 1.0 版發布——你可以用它做研究,但若沒有另行簽訂協議,不得在其上建立商業業務。Gemma 4 12B 則是 Goog​le DeepMind 的無編碼器多模態模型,以 Apache 2.0 發布。這一行授權條款所決定的部署數量,比基準測試表格還多,因此值得從這裡開始,而不是留到最後才談。

這是一項比較,對象是一位專才與一位通才,而他們恰好是同一類物件。TwIL-LM3-Pro 只做一件事——形式邏輯——而且做得比規模為其數倍的模型更好。Gemma 4 12B 則做很多事,能看、能聽,也能讀,而且是刻意打造來成為他人產品中預設小型模型的。把兩者的規格表拿來相互對照,彷彿它們在競逐同一個定位,正是本頁存在的目的所要避免的錯誤。

授權條款是第一份規格。

TwIL-LM3-Pro 的授權允許複製、研究及個人使用,並明確要求用於產生營收的部署時,須與 webAI 另行簽訂協議。授權也限制未經書面同意使用 webAI 的商號名稱與商標。對業餘愛好者、博士生或內部研究團隊而言,這是完整的許可。對任何要推出產品的人來說,在協議存在之前則是絕對禁止——而 webAI 的商業途徑是企業級安排,並非公開的價目表。

Gemma 4 12B 採用 Apache 2.0 授權。你可以對它進行微調、重新散布其衍生作品、將其提供給客戶使用,並把它內建於商業產品中出貨,但須遵守 Goog​le 的使用政策。這不是程度上的微小差異;而是你能評估的模型,與你能據以建構的模型之間的差別。

兩者在 Hugging Face 上都是無門檻下載,因此授權條款是唯一的關卡,而它確實是一道實實在在的關卡。

每個模型實際上是用來做什麼的

TwIL-LM3-Pro 承襲自 `ibm-granite/granite-4.2-3b`,歷經五階段流程——在合成形式邏輯語料庫上進行 LoRA 監督式微調、多路徑蒸餾、檢查點融合、以 WiSE-FT 插值回歸預訓練基礎模型,以及以熵加權的 GRPO 階段,對抗程式化驗證器。它的目標輸出是物件而非散文:一階邏輯翻譯、蘊含標籤、語意剖析、Lean 陳述,以及 Lean 證明評論。webAI 明確表示,該模型並非通用助理,且除了 Granite 4.2 原有的內容外,並未附帶任何安全或偏好調校。

Gemma 4 12B 則是相反的建構方式。它是 Gemma 4 家族中擁有 119.5 億參數的稠密模型成員——48 層、26.2 萬詞彙量、25.6 萬個 token 的脈絡視窗——而且原生支援多模態,透過無編碼器架構處理文字、圖像與音訊,而不是另外加裝獨立的視覺與音訊塔。所有 Gemma 4 模型都隨附可設定的思考模式、原生系統提示支援與函式呼叫功能。它的設計目標是成為通用推理與多模態的主力,且尺寸適合消費級 GPU。

要求 TwIL-LM3-Pro 描述一張照片並不是公平的測試,也不是這個模型被打造來接受的測試。要求 Gemma 4 12B 按照固定綱要產生語意解析,同樣不是它被調校來執行的工作。重疊確實存在,但很狹窄:兩者都能推理,也都能離線執行。

實際上不同的維度

• 參數 — TwIL-LM3-Pro 3.66B 稠密對比 Gemma 4 12B 11.95B 稠密,約為 3.3 倍。

• 上下文視窗 — TwIL-LM3-Pro:131,072 個 token,沿用其 Granite 基礎模型且維持不變;Gemma 4 12B:256,000 個 token。

• 輸入模態 — TwIL-LM3-Pro 僅限文字;Gemma 4 12B 則支援文字、圖像、視訊與音訊。

• 授權條款 — webAI 非商業授權條款 1.0 版 與 Apache 2.0。

• 基礎模型 — `ibm-granite/granite-4.2-3b` 對比 Goog​le 自家的 Gemma 4 預訓練,隨技術報告一同發布。

• 思考格式 — TwIL-LM3-Pro 預設會在回答前輸出一個 `<think>` 區塊;Gemma 4 則在整個系列中提供可設定的思考模式。

• 量化後佔用空間 — TwIL-LM3-Pro Q4_K_M 為 2.09 GiB,可在 CPU 或 4 GB VRAM 上執行;Gemma 4 12B 以 bf16 執行時約為 24 GiB,適合消費級 GPU,而非筆記型電腦的內建顯示晶片。

最後這一句,最尖銳地戳破了「兩者都在本機執行」這個說法,值得把話說得精確一點。TwIL-LM3-Pro 的「本機」宣稱,是筆電等級的宣稱。Gemma 4 12B 的「本機」宣稱,則是工作站 GPU 等級的宣稱,而 Google 較小的 E2B 與 E4B 模型才真正對應手機與筆電這個層級。兩個都被稱為「本機」的模型,並不代表同樣的硬體門檻。

基準證據的現況

TwIL-LM3-Pro 的每一項效能數據都來自 webAI 自家的模型卡,且是在該公司自家的 Track A 與 Track B 測試框架上測得。目前尚無獨立評估。模型卡本身所強調的比較對象是 Qwen3-8B,而非任何 Gemma 模型——webAI 的巨觀閘門分數 0.5539 對上 Qwen3-8B 的 0.5336,而模型卡形容這樣的領先幅度落在取樣雜訊之內;以及 strict-7 的 0.2879 對上 0.2093,此處的差距並不依賴寬鬆比對計分。相較於自家 Granite 4.2 3B 基礎模型,領域內的巨觀閘門分數從 0.4313 升至 0.5539,而留出集的 10 資料集巨觀分數則持平,分別為 0.7901 與 0.7942。

Gemma 4 12 有一份已發表的技術報告,以及大量第三方評估。它在自家系列中也有一個廠商提供的基準排名位置——Goog​le 在其自家的推理與程式編寫表中,將 12B Unified 版本排在 31B 和 26B A4B 之下。那個排名是 Goog​le 的,值得如實引用。

關於直接正面對決,最誠實的說法是:根本沒有這種比較。沒有人曾讓 TwIL-LM3-Pro 和 Gemma 4 12B 跑過同一套測試框架並公布結果。這兩者從未由任何人以同一套評分規準評分,因為它們各自被評分的規準並不重疊。形式邏輯蘊含準確率和 MMLU-Pro 百分比並不是同一種單位。

當每一個都是正確的選擇時

當你需要輸出的是機器可檢查的結構——例如蘊含標籤、Lean 陳述、語意剖析——而工作負載屬於批次或離線,且授權條款不構成你如何使用結果的限制時,就選用 TwIL-LM3-Pro。其 2.09 GiB 量化版本可在 CPU 上執行,且不依賴網路,對氣隙管線或必須在筆電上執行的標註作業來說,是實實在在的優勢。

當你需要一個可交付的通用模型、當輸入不是文字、當上下文很長,或當你需要微調並重新發佈時,請選用 Gemma 4 12B。Apache 2.0 加上原生多模態,再加上 256K 視窗,是專精特定領域的模型都無法提供的組合。

這兩者也可以共存。一條使用 Gemma 4 12B 讀取並正規化混合模態輸入,然後把結構化陳述交給形式邏輯專家的管線,是合理的分工;這與用前沿模型起草、再用小型模型驗證是同一種形態。

從單一端點提供其中任一項

TwIL-LM3-Pro 與 Gemma 4 12B Unified 建置目前都不是 OrcaRouter 目錄中的路由,而這一點值得在提出建議之前、而非之後說明。同一系列中實際被路由的是較大型的 Gemma 4 層級——`gemma-4-26b-a4b-it` 與 `gemma-4-31b-it`——因此這裡常見的模式是先針對託管的 Gemma 4 層級,製作提示與結構描述的雛型透過 OpenAI 相容端點,以供應商牌價、零加成使用,再將已定案的工作負載移至你自己硬體上的 12B 檢查點。同一個端點提供 200 多個模型,因此你用來產生評估資料的前沿模型,與你用來檢查它的小型模型,只差一把金鑰與一種請求格式,若供應商在執行中途不穩,會自動容錯移轉。

這比平常的路由論述更站不住腳,也應該照實這樣說:我們並未託管你所比較的模型,所以誠實的建議是一套工作流程,而不是一個切換選項。

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Gemma 4 12B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Context 131,072 tokens; Input text only; Licence non-commercial; Base granite-4.2-3b; Quantised size 2.09 GiB Q4_K_M. Gemma 4 12B: Parameters 11.95B dense; Context 256,000 tokens; Input text, image, audio; Licence Apache 2.0; Base Google Gemma 4 pretraining; Quantised size about 24 GiB in bf16. A footer line reads 'Gemma figures per Google model card; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

決策規則

如果交付成果必須能商業部署,授權條款會在任一基準測試之前先回答這個問題,而答案指向 Gemma 4 12B。如果交付成果是離線產出、供內部取用的形式邏輯輸出,TwIL-LM3-Pro 是體積僅三分之一卻更強大的工具。如果你兩者都需要,真正有意思的工程挑戰不是挑出贏家——而是定義通用多模態模型止步、形式邏輯專家接手的那道介面。

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, dated 2026-04-02, showing the 30.7B dense multimodal description, a 256K token context window, the $0.13 input and $0.38 output rate, and the OrcaRouter chrome with Code samples, Pricing, Performance, Public benchmarks and FAQ sections.A screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing the Google author line, the Any-to-Any, Transformers, Safetensors and gemma4_unified tags, the Apache 2.0 licence badge, and the opening text describing the Gemma 4 12B Unified model as part of the Gemma 4 family with native audio and vision understanding and no separate encoders.