
TwIL-LM3-Pro 対 Gemma 4 12B:ラップトップ以外に何の共通点もない2つのローカルモデル
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
を並べてみると、TwIL-LM3-ProとGemma 4 12B似ている点は確かにありますが、浅いものです。どちらも今日すぐにダウンロードできるオープンなチェックポイントで、クラウドアカウントなしでコンシューマー向けハードウェア上で動作し、オフラインで質問に答えてくれます。しかしそれ以降はすべてが分かれていき、最も鋭い相違点は技術的なものではなく法的なものです。webAIの3.66Bの形式論理特化モデルであるTwIL-LM3-Proは、webAI Non-Commercial License ver. 1.0の下で提供されています——研究に使うことはできますが、別途契約を結ばない限りそれを使ってビジネスを築くことはできません。Google DeepMindのエンコーダー不要のマルチモーダルモデルであるGemma 4 12Bは、Apache 2.0の下で提供されています。この一行が、ベンチマークの表よりも多くのデプロイを左右するのです。だからこそ、最後に扱うのではなく、そこから始める価値があります。
これは、同じ種類のオブジェクトでありながら専門特化型と汎用型という対比になっている二者の比較です。TwIL-LM3-Pro は形式的論理という一つの仕事だけを担い、その仕事においては何倍も大きなモデルよりも優れています。Gemma 4 12B は多くの仕事をこなし、読み取りだけでなく見たり聞いたりもでき、誰かの製品における既定の小型モデルとなるよう意図的に設計されています。両者の仕様書を、まるで同じ枠を争っているかのように突き合わせて読むこと——それが、このページが防ぐために存在する誤りです。
ライセンスは最初の仕様です。
TwIL-LM3-Proのライセンスは、複製、研究、個人利用を許可しており、収益を生み出す展開にはwebAIとの別途契約が明示的に必要です。また、書面による同意なしにwebAIの商号および商標を使用することを制限しています。趣味の利用者、博士課程の学生、社内研究グループにとっては、それが完全な許可となります。製品を出荷する者にとっては、契約が存在するまで完全な行き止まりであり、webAIの商用ルートはエンタープライズ向けの取り決めであって、公開された料金表ではありません。
Gemma 4 12BはApache 2.0です。ファインチューニングし、派生版を再配布し、顧客に提供し、商用製品に組み込んで出荷することができます。ただしGoogleの利用ポリシーに従うことが条件です。それは程度の小さな違いではありません。評価できるモデルと、その上に構築できるモデルとの違いなのです。
どちらもHugging Face上のゲートなしのダウンロードなので、ライセンスだけが唯一の関門であり、それは実際に本物の障壁だ。
各モデルが実際に何のためにあるのか
TwIL-LM3-Proは、`ibm-granite/granite-4.2-3b` から、5段階のパイプライン——合成形式論理コーパスに対するLoRA教師ありファインチューニング、マルチパス蒸留、チェックポイント融合、事前学習済みベースへ戻す方向のWiSE-FT補間、そしてプログラムによる検証器に対するエントロピー重み付きGRPO段階——を通じて派生している。その目標出力は文章ではなくオブジェクトである。すなわち、一階述語論理の翻訳、含意ラベル、意味解析、Lean文、Lean証明の批評である。webAIは、このモデルが汎用アシスタントではなく、Granite 4.2が備えていたものを超える安全性や選好のチューニングは一切施されていないと明確に述べている。
Gemma 4 12Bは対照的な構成です。これはGemma 4ファミリーの11.95Bパラメータの密なモデルで、48層、262K語彙、256Kトークンのコンテキストウィンドウを備え、ネイティブにマルチモーダルであり、別個のビジョン塔と音声塔を後付けするのではなく、エンコーダーフリーのアーキテクチャを通じてテキスト、画像、音声を処理します。すべてのGemma 4モデルには、設定可能な思考モード、ネイティブのシステムプロンプトサポート、関数呼び出しが搭載されています。これは、コンシューマーGPUに収まるサイズで、汎用推論とマルチモーダルの主力となるよう設計されています。
TwIL-LM3-Proに写真を説明させるのは公正なテストではなく、そのモデルが受けるように作られたテストでもない。Gemma 4 12Bに固定スキーマで意味解析を出力させることも、それが調整された仕事ではない。重なりは現実に存在するが狭い。どちらも推論でき、どちらもオフラインで動作できる。
{{1}}実際に異なる次元{{/1}}
• パラメータ — TwIL-LM3-Pro 3.66B dense 対 Gemma 4 12B 11.95B dense、約3.3倍。
• コンテキストウィンドウ — TwIL-LM3-Pro 131,072トークン、Graniteベースから変更なく継承、Gemma 4 12B 256,000トークン。
• 入力モダリティ — TwIL-LM3-Pro はテキストのみ、Gemma 4 12B はテキスト、画像、動画、音声。
• ライセンス — webAI Non-Commercial License ver. 1.0 対 Apache 2.0
• ベースモデル — `ibm-granite/granite-4.2-3b` vs Google自身のGemma 4事前学習(技術レポートと同時公開)。
• 思考形式 — TwIL-LM3-Pro は、回答する前にデフォルトで `<think>` ブロックを出力します;Gemma 4 は、ファミリー全体で設定可能な思考モードを公開しています。
• 量子化フットプリント — TwIL-LM3-Pro Q4_K_M は 2.09 GiB で、CPU または 4 GB の VRAM 上で動作します。Gemma 4 12B の bf16 は約 24 GiB で、ノート PC の統合グラフィックスではなく、コンシューマー向け GPU に合わせたサイズです。
その最後の一行こそが、「どちらもローカルで動作する」という枠組みを最も鋭く掘り崩すものであり、そこは正確に述べておく価値がある。TwIL-LM3-Pro のローカルという主張は、ラップトップでの主張だ。Gemma 4 12B のローカルという主張は、ワークステーションGPUでの主張であり、Googleのより小型の E2B と E4B モデルが、真にスマートフォンとラップトップの層を担っている。どちらもローカルと呼ばれる2つのモデルは、同じハードウェア基準ではない。
ベンチマークの根拠の現状
TwIL-LM3-Pro のすべての性能数値は、webAI 自身のモデルカードに由来し、同社独自の Track A および Track B ハーネスで測定されている。独立した評価はまだ存在しない。カード自体が強調している比較対象は Qwen3-8B であり、いかなる Gemma モデルとの比較でもない。webAI のマクロゲート 0.5539 対 Qwen3-8B の 0.5336 で、そのリードはカードがサンプリングノイズ内と記述しているものであり、また strict-7 は 0.2879 対 0.2093 で、この差は緩い一致による加点に依存しない。自身の Granite 4.2 3B ベースと比較すると、ドメイン内マクロゲートは 0.4313 から 0.5539 へ上昇する一方、ホールドアウト 10 データセットのマクロは 0.7901 対 0.7942 で横ばいのままである。
Gemma 4 12Bには公開された技術レポートがあり、第三者による幅広い評価も数多く存在します。また、自社ファミリー内でのベンダー報告によるベンチマーク上の位置づけもあり、Googleは独自の推論およびコーディングの表において、12B Unifiedビルドを31Bと26B A4Bより下位に位置づけています。その順位はGoogleによるものであり、そのように引用する価値があります。
直接の一対一比較について正直に言えば、そんなものは存在しない。TwIL-LM3-Pro と Gemma 4 12B を共通の評価ハーネスで走らせ、その結果を公表した者はいない。誰も両者を同じ評価基準で採点したことはない。なぜなら、両者が採点される際の評価基準は重なっていないからだ。形式論理の含意推論の正答率と MMLU-Pro のパーセンテージは、同じ単位ではない。
それぞれが正しい選択となるのはいつか
TwIL-LM3-Pro は、必要な出力が機械検証可能な構造——含意ラベル、Lean の文、意味解析——であり、作業負荷がバッチまたはオフラインで、その結果をどう扱うかについてライセンスが制約にならない場合に選ぶとよい。CPU 上で動作しネットワーク依存のない 2.09 GiB の量子化ビルドは、エアギャップ環境のパイプラインや、ラップトップ上で実行する必要があるラベリング処理にとって、確かな利点である。
出荷できる汎用モデルが必要なとき、入力がテキストでないとき、コンテキストが長いとき、またはファインチューニングして再配布したいときは、Gemma 4 12B を選びましょう。Apache 2.0 に、ネイティブのマルチモーダル対応と 256K のウィンドウを加えた組み合わせは、狭い領域に特化したどのモデルも提供していません。
両者は共存もできる。Gemma 4 12B を使って混合モダリティの入力を読み取り・正規化し、その後、構造化された文を形式論理の専門家に渡すパイプラインは、合理的な分業であり、フロンティアモデルに下書きをさせ、小型モデルに検証させるのと同じ形である。
どちらか一方を1つのエンドポイントから配信する
TwIL-LM3-Pro も Gemma 4 12B Unified ビルドも、現在 OrcaRouter のカタログにあるルートではありません。そのことは、推奨の後ではなく前に述べておく価値があります。同じファミリーからルーティングされているのは、より大規模な Gemma 4 ティア、つまり `gemma-4-26b-a4b-it` と `gemma-4-31b-it` です。したがって、ここでよくあるパターンは、プロンプトとスキーマをホスト型 Gemma 4 ティアに対してプロトタイプすることです OpenAI 互換エンドポイント経由で、プロバイダーの定価に 0% のマークアップを加えた価格で、その後、確定したワークロードを自分のハードウェア上の 12B チェックポイントに移します。同じエンドポイントが 200 以上のモデルに対応しているため、評価データを生成するために使うフロンティアモデルと、それを確認するために使う小規模モデルは、1 つのキーと 1 つのリクエスト形式の違いしかありません プロバイダーが実行途中で不安定になった場合の自動フェイルオーバー付き。
それはいつものルーティングの話より弱いバージョンであり、そう伝えるべきです。当社はあなたが比較しているモデルをホストしていないため、正直なアドバイスは切り替えではなくワークフローになります。

決定規則
もし成果物が商用デプロイ可能でなければならないなら、その問いにはどのベンチマークよりも先にライセンスが答えを出し、それは Gemma 4 12B を指している。もし成果物がオフラインで生成され社内で利用される形式論理の出力なら、TwIL-LM3-Pro は3分の1のサイズでより強力なツールだ。両方が必要な場合、興味深いエンジニアリングは勝者を選ぶことではない — 汎用マルチモーダルモデルが終わり、形式論理の専門家が始まるインターフェースを定義することだ。


