
TwIL-LM3-Pro vs. Gemma 4 12B: Zwei lokale Modelle, die nichts außer dem Laptop gemeinsam haben
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 219 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Stell TwIL-LM3-Pro und Gemma 4 12B nebeneinander, und die Ähnlichkeiten sind real, aber oberflächlich: Beide sind offene Checkpoints, die man heute herunterladen kann, beide laufen auf Consumer-Hardware ohne Cloud-Konto, und beide beantworten Fragen offline. Alles darüber Hinausgehende geht auseinander, und die schärfste Divergenz ist eher rechtlicher als technischer Natur. TwIL-LM3-Pro, der 3,66B-Spezialist für formale Logik von webAI, erscheint unter der webAI Non-Commercial License ver. 1.0 – man darf damit forschen, aber ohne separate Vereinbarung kein Geschäft darauf aufbauen. Gemma 4 12B, das encoderfreie multimodale Modell von Google DeepMind, erscheint unter Apache 2.0. Diese eine Zeile entscheidet über mehr Deployments als die Benchmark-Tabelle, deshalb lohnt es sich, dort anzufangen statt dort zu enden.
Dies ist ein Vergleich zwischen einem Spezialisten und einem Generalisten, die zufällig dieselbe Art von Objekt sind. TwIL-LM3-Pro erledigt eine Aufgabe – formale Logik – und erledigt sie besser als Modelle, die ein Vielfaches seiner Größe haben. Gemma 4 12B erledigt viele Aufgaben, kann ebenso sehen und hören wie lesen und ist bewusst darauf ausgelegt, das Standard-Kleinmodell im Produkt eines anderen zu sein. Ihre Datenblätter gegeneinander zu lesen, als würden sie um denselben Platz konkurrieren, ist der Fehler, den diese Seite verhindern soll.
Die Lizenz ist die erste Spezifikation
Die Lizenz von TwIL-LM3-Pro erlaubt Vervielfältigung, Forschung und persönliche Nutzung und verlangt ausdrücklich eine separate Vereinbarung mit webAI für eine umsatzgenerierende Bereitstellung. Sie schränkt außerdem die Nutzung von webAIs Handelsnamen und Marken ohne schriftliche Zustimmung ein. Für einen Hobbyisten, einen Doktoranden oder eine interne Forschungsgruppe ist das eine vollständige Erlaubnis. Für jeden, der ein Produkt auf den Markt bringt, ist es ein hartes Aus, bis eine Vereinbarung vorliegt – und webAIs kommerzieller Weg ist eine Unternehmensvereinbarung, keine veröffentlichte Preisliste.
Gemma 4 12B ist Apache 2.0. Sie können es feinabstimmen, das Derivat weiterverbreiten, es Kunden zur Verfügung stellen und es in ein kommerzielles Produkt integrieren – vorbehaltlich Googles Nutzungsrichtlinie. Das ist kein kleiner gradueller Unterschied; es ist der Unterschied zwischen einem Modell, das Sie evaluieren können, und einem Modell, auf dem Sie aufbauen können.
Beide sind Downloads ohne Zugangsbeschränkung auf Hugging Face, also ist die Lizenz die einzige Hürde – und die ist real.
Wofür jedes Modell eigentlich gedacht ist
TwIL-LM3-Pro geht in einer fünfstufigen Pipeline aus `ibm-granite/granite-4.2-3b` hervor — überwachtes LoRA-Feintuning auf einem synthetischen formallogischen Korpus, Multipfad-Destillation, Checkpoint-Fusion, eine WiSE-FT-Interpolation zurück zur vortrainierten Basis und eine entropiegewichtete GRPO-Phase gegen einen programmatischen Verifizierer. Seine Zielausgaben sind Objekte statt Prosa: Übersetzungen in Prädikatenlogik erster Stufe, Entailment-Labels, semantische Parses, Lean-Aussagen und Lean-Beweiskritiken. webAI stellt klar, dass das Modell kein allgemeiner Assistent ist und keine Sicherheits- oder Präferenzabstimmung über das hinaus aufweist, was Granite 4.2 besaß.
Gemma 4 12B ist die entgegengesetzte Konstruktion. Es ist das dichte Mitglied der Gemma-4-Familie mit 11,95 Mrd. Parametern – 48 Schichten, ein Vokabular von 262K, ein Kontextfenster von 256K Token – und es ist nativ multimodal: Es verarbeitet Text, Bild und Audio über eine encoderfreie Architektur, statt separate Vision- und Audio-Türme anzuflanschen. Alle Gemma-4-Modelle werden mit konfigurierbaren Denkmodi, nativer System-Prompt-Unterstützung und Funktionsaufrufen ausgeliefert. Es ist als allgemeines Arbeitstier für Reasoning und multimodale Aufgaben in einer Größe konzipiert, die auf eine Consumer-GPU passt.
TwIL-LM3-Pro zu bitten, ein Foto zu beschreiben, ist kein fairer Test, und es ist kein Test, für den das Modell gebaut wurde. Gemma 4 12B zu bitten, eine semantische Analyse in einem festen Schema auszugeben, ist ebenfalls nicht die Aufgabe, für die es optimiert wurde. Die Überschneidung ist real, aber klein: Beide können logisch schlussfolgern, und beide können offline laufen.
Die Dimensionen, die sich tatsächlich unterscheiden
• Parameter — TwIL-LM3-Pro 3.66B dense vs. Gemma 4 12B 11.95B dense, ein Faktor von ungefähr 3,3.
• Kontextfenster — TwIL-LM3-Pro 131.072 Tokens, unverändert von seiner Granite-Basis übernommen; Gemma 4 12B 256.000 Tokens.
• Modalitäten in — TwIL-LM3-Pro nur Text; Gemma 4 12B Text, Bild, Video und Audio.
• Lizenz — webAI Non-Commercial License Version 1.0 vs. Apache 2.0.
• Basismodell — `ibm-granite/granite-4.2-3b` vs. Googles eigenes Gemma-4-Pretraining, veröffentlicht zusammen mit einem technischen Bericht.
• Denkformat — TwIL-LM3-Pro gibt standardmäßig vor der Antwort einen `<think>`-Block aus; Gemma 4 bietet über die gesamte Familie hinweg konfigurierbare Denkmodi.
• Quantisierter Speicherbedarf — TwIL-LM3-Pro Q4_K_M mit 2,09 GiB, läuft auf CPU oder 4 GB VRAM; Gemma 4 12B in bf16 belegt rund 24 GiB und ist eher für eine Consumer-GPU als für die integrierte Grafik eines Laptops ausgelegt.
Diese letzte Zeile ist diejenige, die die Darstellung „beide laufen lokal“ am schärfsten untergräbt, und es lohnt sich, hier präzise zu sein. Der lokale Anspruch von TwIL-LM3-Pro ist ein Laptop-Anspruch. Der lokale Anspruch von Gemma 4 12B ist ein Workstation-GPU-Anspruch, wobei Googles kleinere Modelle E2B und E4B die tatsächliche Telefon-und-Laptop-Klasse bedienen. Zwei Modelle, die beide als lokal bezeichnet werden, sind nicht dieselbe Hardware-Messlatte.
Wo die Benchmark-Evidenz steht
Jede Leistungskennzahl für TwIL-LM3-Pro stammt aus webAIs eigener Modellkarte und wurde auf den unternehmenseigenen Track-A- und Track-B-Testumgebungen gemessen. Eine unabhängige Evaluierung liegt noch nicht vor. Der Vergleich, den die Karte selbst hervorhebt, richtet sich gegen Qwen3-8B, nicht gegen ein Gemma-Modell – webAIs Makro-Gate von 0.5539 gegenüber Qwen3-8B mit 0.5336, mit einem Vorsprung, den die Karte als innerhalb des Stichprobenrauschens beschreibt, und strict-7 von 0.2879 gegenüber 0.2093, wo die Lücke nicht von Gutschriften für lose Übereinstimmungen abhängt. Gegenüber der eigenen Basis Granite 4.2 3B steigt das In-Domain-Makro-Gate von 0.4313 auf 0.5539, während das Makro über die 10 zurückgehaltenen Datensätze mit 0.7901 gegenüber 0.7942 konstant bleibt.
Gemma 4 12B verfügt über einen veröffentlichten technischen Bericht und über eine breite Basis an Bewertungen durch Dritte. Es hat außerdem eine vom Anbieter gemeldete Benchmark-Position innerhalb seiner eigenen Familie – Google stuft den 12B Unified Build in seinen eigenen Reasoning- und Coding-Tabellen unter dem 31B und dem 26B A4B ein. Diese Einstufung ist Googles eigene, und es lohnt sich, sie als solche zu zitieren.
Die ehrliche Aussage über einen direkten Kopf-an-Kopf-Vergleich ist, dass es keinen gibt. Niemand hat TwIL-LM3-Pro und Gemma 4 12B durch eine gemeinsame Testumgebung laufen lassen und das Ergebnis veröffentlicht. Die beiden wurden nie von irgendjemandem nach demselben Bewertungsraster bewertet, weil die Bewertungsraster, nach denen sie bewertet werden, sich nicht überschneiden. Eine Genauigkeit bei formal-logischer Implikation und ein MMLU-Pro-Prozentwert sind nicht dieselbe Einheit.
Wann jede einzelne die richtige Wahl ist
Greifen Sie zu TwIL-LM3-Pro, wenn die Ausgabe, die Sie benötigen, eine maschinenprüfbare Struktur ist – ein Entailment-Label, ein Lean-Statement, ein semantischer Parse – und es sich um eine Batch- oder Offline-Arbeitslast handelt und die Lizenz keine Einschränkung für das darstellt, was Sie mit dem Ergebnis tun. Sein 2,09 GiB quantisierter Build, der auf der CPU ohne Netzwerkabhängigkeit läuft, ist ein echter Vorteil für eine air-gapped Pipeline oder einen Labeling-Durchlauf, der auf einem Laptop laufen muss.
Greifen Sie zu Gemma 4 12B, wenn Sie ein allgemeines Modell benötigen, das Sie ausliefern können, wenn die Eingabe kein Text ist, wenn der Kontext lang ist oder wenn Sie feinabstimmen und weiterverbreiten möchten. Apache 2.0 plus native Multimodalität plus ein 256K-Fenster ist eine Kombination, die keiner der eng fokussierten Spezialisten bietet.
Die beiden können auch koexistieren. Eine Pipeline, die Gemma 4 12B nutzt, um eine gemischtmodale Eingabe zu lesen und zu normalisieren, und dann eine strukturierte Aussage an einen Spezialisten für formale Logik weitergibt, ist eine vernünftige Arbeitsteilung, und sie hat dieselbe Form wie die Nutzung eines Frontier-Modells zum Entwerfen und eines kleinen Modells zum Verifizieren.
Bereitstellung eines von beiden über einen einzigen Endpunkt
Weder TwIL-LM3-Pro noch der Gemma 4 12B Unified build ist derzeit eine Route im OrcaRouter-Katalog, und das sollte man vor der Empfehlung erwähnen und nicht danach. Was aus derselben Familie geroutet wird, sind die größeren Gemma-4-Tiers — `gemma-4-26b-a4b-it` und `gemma-4-31b-it` —, sodass das übliche Muster hier darin besteht, einen Prototyp des Prompts und des Schemas gegen ein gehostetes Gemma-4-Tier über einen OpenAI-kompatiblen Endpunkt zum Listenpreis des Anbieters mit 0 % Aufschlag zu erstellen, und dann die festgelegte Workload auf den 12B-Checkpoint auf Ihrer eigenen Hardware zu verlagern. Derselbe Endpunkt bedient über 200 Modelle, sodass das Frontier-Modell, das Sie zur Generierung von Evaluierungsdaten verwenden, und das kleine Modell, mit dem Sie diese prüfen, nur einen Schlüssel und ein Anfrageformat voneinander entfernt sind, mit automatischem Failover, falls ein Anbieter mitten im Lauf instabil wird.
Das ist eine schwächere Version der Routing-Story als üblich, und sie sollte auch so dargestellt werden: Wir hosten das Modell, das Sie vergleichen, nicht, daher ist die ehrliche Empfehlung ein Workflow und kein Wechsel.

Die Entscheidungsregel
Wenn das Ergebnis kommerziell einsetzbar sein muss, beantwortet die Lizenz die Frage, bevor es irgendein Benchmark tut, und sie verweist auf Gemma 4 12B. Wenn das Ergebnis eine offline erzeugte und intern genutzte formallogische Ausgabe ist, ist TwIL-LM3-Pro das stärkere Werkzeug bei einem Drittel der Größe. Wenn Sie beides brauchen, besteht die interessante Ingenieursleistung nicht darin, einen Sieger zu küren — sondern darin, die Schnittstelle zu definieren, an der ein allgemeines multimodales Modell aufhört und ein Spezialist für formale Logik beginnt.


