一张生成的标题卡,标题为“TwIL-LM3-Pro vs Gemma 4 12B”,副标题为“两个本地模型,两种许可证”,并有两张圆角卡片,分别写着“TwIL-LM3-Pro - 非商业”和“Gemma 4 12B - Apache 2.0”。页脚一行写着“许可证所决定的部署数量,超过任何一行基准测试结果。”OrcaRouter 标志合成在右下角。
Guides & Insights

TwIL-LM3-Pro vs Gemma 4 12B:两个除了笔记本电脑外毫无共同点的本地模型

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

将TwIL-LM3-Pro和Gemma 4 12B并排放在一起,会发现二者的相似之处真实存在,却很浅层:两者都是你今天就下载得到的开放检查点,都能在消费级硬件上运行、无需云账户,也都能离线回答问题。除此之外,一切便分道扬镳,而最尖锐的分歧在于法律,而非技术。TwIL-LM3-Pro 是 webAI 的 3.66B 形式逻辑专用模型,依据 webAI 非商业许可证 1.0 版发布——你可以用它做研究,但未经另行签署协议,不得在此基础上开展商业业务。Gemma 4 12B 是 Goog​le DeepMind 的无编码器多模态模型,采用 Apache 2.0 许可证发布。这一行条款所决定的部署数量,比基准测试表格所决定的还要多,因此值得从这里开始谈起,而不是留到末尾才提。

这是一个专家和一个通才之间的比较,而它们恰好是同一种对象。TwIL-LM3-Pro 只做一件事——形式逻辑——并且比规模大它几倍的模型做得更好。Gemma 4 12B 能做很多事,既能看和听,也能读,并且被有意构建为别人产品中的默认小型模型。把它们的规格表拿来相互比较,好像它们在竞争同一个位置,正是本页旨在防止的错误。

许可证是第一项规范

TwIL-LM3-Pro 的许可证允许复制、研究和个人使用,并明确要求,若要进行创收型部署,必须与 webAI 另行签订协议。它还限制未经书面同意使用 webAI 的商号和商标。对于爱好者、博士生或内部研究团队而言,这是完全许可。对于任何要发布产品的人而言,在协议达成之前,这是一道硬性障碍——而 webAI 的商业路径是企业级安排,并非公开的价目表。

Gemma 4 12B 采用 Apache 2.0 许可。你可以对它进行微调、再分发其衍生版本、将其部署给客户使用,并将它打包进商业产品中,但须遵守 Goog​le 的使用政策。这并非程度上的细微差别;这是你可以评估的模型与你可以据以构建的模型之间的差别。

两者在 Hugging Face 上都是无需审批的下载,所以许可协议是唯一的门槛,而它是一道实实在在的门槛。

每个模型的实际用途

TwIL-LM3-Pro 源自 `ibm-granite/granite-4.2-3b`,经过一条五阶段流水线:在合成形式逻辑语料上进行 LoRA 监督微调、多路径蒸馏、检查点融合、朝预训练基座回插值的 WiSE-FT,以及针对程序化验证器的熵加权 GRPO 阶段。它的目标输出是对象而非自然语言文本:一阶逻辑翻译、蕴涵标签、语义解析、Lean 语句和 Lean 证明评述。webAI 明确表示,该模型不是通用助手,并且除 Granite 4.2 本身具备的之外,不带有任何安全或偏好调优。

Gemma 4 12B 则采用了相反的构建方式。它是 Gemma 4 家族中拥有 119.5 亿参数的稠密模型——48 层、262K 词表、256K token 上下文窗口——并且原生支持多模态,通过无编码器架构处理文本、图像和音频,而不是外挂独立的视觉和音频塔。所有 Gemma 4 模型都随附可配置的思考模式、原生系统提示支持和函数调用。它的设计目标是在适合消费级 GPU 的规模下,成为通用推理与多模态的主力。

让 TwIL-LM3-Pro 描述一张照片并不是一项公平的测试,也不是这个模型被构建来接受的测试。让 Gemma 4 12B 按固定模式输出语义解析,同样不是它被调优来完成的任务。两者的重叠确实存在,但很狭窄:二者都能推理,也都能离线运行。

真正不同的维度

• 参数 — TwIL-LM3-Pro 3.66B 稠密模型 对比 Gemma 4 12B 11.95B 稠密模型,相差约 3.3 倍。

• 上下文窗口 — TwIL-LM3-Pro 131,072 个 token,从其 Granite 基座原样继承;Gemma 4 12B 为 256,000 个 token。

• 输入模态 — TwIL-LM3-Pro 仅支持文本;Gemma 4 12B 支持文本、图像、视频和音频。

• 许可证 — webAI 非商业许可证 1.0 版 与 Apache 2.0 对比。

• 基础模型——`ibm-granite/granite-4.2-3b` 对比 Google 自家的 Gemma 4 预训练,随一份技术报告一同发布。

• 思考格式 —— TwIL-LM3-Pro 在回答前默认输出一个 `<think>` 块;Gemma 4 在整个系列中提供可配置的思考模式。

• 量化后占用 — TwIL-LM3-Pro Q4_K_M 为 2.09 GiB,可在 CPU 或 4 GB 显存上运行;bf16 下的 Gemma 4 12B 约为 24 GiB,其规模面向消费级 GPU,而非笔记本电脑的集成显卡。

最后那句话最尖锐地削弱了“两者都在本地运行”这一说法,而且值得把这一点说清楚。TwIL-LM3-Pro 所说的本地运行,是笔记本电脑级别的。Gemma 4 12B 所说的本地运行,则是工作站 GPU 级别的;Google 更小的 E2B 和 E4B 模型才服务于真正的手机和笔记本层级。两个都被称作“本地”的模型,并不意味着相同的硬件门槛。

基准证据现状

TwIL-LM3-Pro 的每一项性能数据都来自 webAI 自己的模型卡,并且是在该公司自己的 Track A 和 Track B 测试框架上测得的。目前尚无独立评估。模型卡本身着重强调的对比是相对于 Qwen3-8B,而不是相对于任何 Gemma 模型——webAI 的 macro gate 为 0.5539,而 Qwen3-8B 为 0.5336,模型卡称这一领先幅度处于采样噪声范围内;strict-7 为 0.2879,而 Qwen3-8B 为 0.2093,这一差距并不依赖于 loose-match credit。相较其自身的 Granite 4.2 3B 基础模型,in-domain macro gate 从 0.4313 升至 0.5539,而 held-out 10-dataset macro 则保持在同一水平,为 0.7901 对 0.7942。

Gemma 4 12B 已发布技术报告,并有大量第三方评估。它在其自身系列内也有一个由厂商报告的基准排名——Google 在自己的推理与编码表格中,将 12B Unified 版本排在 31B 和 26B A4B 之下。这一排名出自 Google,值得照此引用。

关于直接正面较量,诚实的说法是:并不存在这样的较量。没有人让 TwIL-LM3-Pro 和 Gemma 4 12B 跑过同一套测试框架并公布结果。从未有人用同一套评分标准给这两者打过分,因为它们各自被评分的标准并不重叠。形式逻辑蕴涵准确率与 MMLU-Pro 百分比不是同一个单位。

当每一种做法都是正确的选择时

当需要的输出是可机器校验的结构——例如蕴含标签、Lean 命题、语义解析——并且工作负载是批处理或离线,同时许可证并不约束你拿结果做什么时,就选用 TwIL-LM3-Pro。其 2.09 GiB 的量化构建可在 CPU 上运行、不依赖网络,这对气隙隔离的流水线或必须在笔记本电脑上运行的标注流程来说是一个实实在在的优势。

当你需要一个可以交付的通用模型、当输入不是文本、当上下文很长,或者当你需要微调并重新分发时,请选择 Gemma 4 12B。Apache 2.0 加上原生多模态,再加上 256K 窗口,是任何窄领域专用模型都无法提供的组合。

两者可以共存。一条使用 Gemma 4 12B 读取并规范化混合模态输入、再把结构化陈述交给形式逻辑专家的流水线,是一种合理的分工,其形态与用前沿模型起草、用小模型验证是一样的。

从一个端点提供其中任一服务

TwIL-LM3-Pro 和 Gemma 4 12B Unified 构建版目前都不是 OrcaRouter 目录中的一条路由,这一点值得在给出推荐之前说明,而不是之后。同一系列中真正被路由的是更大的 Gemma 4 档位——`gemma-4-26b-a4b-it` 和 `gemma-4-31b-it`——因此这里的常见做法是,先针对某个托管版 Gemma 4 档位来制作提示词和 schema 的原型通过兼容 OpenAI 的端点,按供应商标价、加价 0%,然后把稳定下来的工作负载迁移到你自有硬件上的 12B 检查点。同一个端点可服务 200 多个模型,因此你用来生成评估数据的前沿模型和用来检查它的小模型,只差一个密钥和一种请求格式,并且当某个供应商在运行中途出现波动时会自动故障转移。

那么,那是路由说法的一个较弱版本,而且应该这样表述:由于我们不托管你正在比较的那个模型,所以诚实的建议是给出一个工作流,而不是一次切换。

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Gemma 4 12B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Context 131,072 tokens; Input text only; Licence non-commercial; Base granite-4.2-3b; Quantised size 2.09 GiB Q4_K_M. Gemma 4 12B: Parameters 11.95B dense; Context 256,000 tokens; Input text, image, audio; Licence Apache 2.0; Base Google Gemma 4 pretraining; Quantised size about 24 GiB in bf16. A footer line reads 'Gemma figures per Google model card; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

决策规则

如果交付物必须能够商业化部署,那么许可证会在任何基准测试之前就回答这个问题,而它指向的是 Gemma 4 12B。如果交付物是离线生成、供内部使用的形式逻辑输出,那么 TwIL-LM3-Pro 是更强的工具,而规模只有三分之一。如果你两者都需要,那么有意思的工程问题不在于选出赢家——而在于定义通用多模态模型止步、形式逻辑专家接手的那条分界线。

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, dated 2026-04-02, showing the 30.7B dense multimodal description, a 256K token context window, the $0.13 input and $0.38 output rate, and the OrcaRouter chrome with Code samples, Pricing, Performance, Public benchmarks and FAQ sections.A screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing the Google author line, the Any-to-Any, Transformers, Safetensors and gemma4_unified tags, the Apache 2.0 licence badge, and the opening text describing the Gemma 4 12B Unified model as part of the Gemma 4 family with native audio and vision understanding and no separate encoders.