Eine generierte Titelkarte mit der Überschrift „TwIL-LM3-Pro vs. Gemma 4 12B“ und dem Untertitel „Zwei lokale Modelle, zwei Lizenzen“, dazu zwei abgerundete Karten mit der Aufschrift „TwIL-LM3-Pro – Nicht kommerziell“ bzw. „Gemma 4 12B – Apache 2.0“. Eine Fußzeile lautet: „Die Lizenz entscheidet über mehr Deployments als jede Benchmark-Zeile.“ Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

TwIL-LM3-Pro vs. Gemma 4 12B: Zwei lokale Modelle, die nichts außer dem Laptop gemeinsam haben

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Stell TwIL-LM3-Pro und Gemma 4 12B nebeneinander, und die Ähnlichkeiten sind real, aber oberflächlich: Beide sind offene Checkpoints, die man heute herunterladen kann, beide laufen auf Consumer-Hardware ohne Cloud-Konto, und beide beantworten Fragen offline. Alles darüber Hinausgehende geht auseinander, und die schärfste Divergenz ist eher rechtlicher als technischer Natur. TwIL-LM3-Pro, der 3,66B-Spezialist für formale Logik von webAI, erscheint unter der webAI Non-Commercial License ver. 1.0 – man darf damit forschen, aber ohne separate Vereinbarung kein Geschäft darauf aufbauen. Gemma 4 12B, das encoderfreie multimodale Modell von Goog​le DeepMind, erscheint unter Apache 2.0. Diese eine Zeile entscheidet über mehr Deployments als die Benchmark-Tabelle, deshalb lohnt es sich, dort anzufangen statt dort zu enden.

Dies ist ein Vergleich zwischen einem Spezialisten und einem Generalisten, die zufällig dieselbe Art von Objekt sind. TwIL-LM3-Pro erledigt eine Aufgabe – formale Logik – und erledigt sie besser als Modelle, die ein Vielfaches seiner Größe haben. Gemma 4 12B erledigt viele Aufgaben, kann ebenso sehen und hören wie lesen und ist bewusst darauf ausgelegt, das Standard-Kleinmodell im Produkt eines anderen zu sein. Ihre Datenblätter gegeneinander zu lesen, als würden sie um denselben Platz konkurrieren, ist der Fehler, den diese Seite verhindern soll.

Die Lizenz ist die erste Spezifikation

Die Lizenz von TwIL-LM3-Pro erlaubt Vervielfältigung, Forschung und persönliche Nutzung und verlangt ausdrücklich eine separate Vereinbarung mit webAI für eine umsatzgenerierende Bereitstellung. Sie schränkt außerdem die Nutzung von webAIs Handelsnamen und Marken ohne schriftliche Zustimmung ein. Für einen Hobbyisten, einen Doktoranden oder eine interne Forschungsgruppe ist das eine vollständige Erlaubnis. Für jeden, der ein Produkt auf den Markt bringt, ist es ein hartes Aus, bis eine Vereinbarung vorliegt – und webAIs kommerzieller Weg ist eine Unternehmensvereinbarung, keine veröffentlichte Preisliste.

Gemma 4 12B ist Apache 2.0. Sie können es feinabstimmen, das Derivat weiterverbreiten, es Kunden zur Verfügung stellen und es in ein kommerzielles Produkt integrieren – vorbehaltlich Goog​les Nutzungsrichtlinie. Das ist kein kleiner gradueller Unterschied; es ist der Unterschied zwischen einem Modell, das Sie evaluieren können, und einem Modell, auf dem Sie aufbauen können.

Beide sind Downloads ohne Zugangsbeschränkung auf Hugging Face, also ist die Lizenz die einzige Hürde – und die ist real.

Wofür jedes Modell eigentlich gedacht ist

TwIL-LM3-Pro geht in einer fünfstufigen Pipeline aus `ibm-granite/granite-4.2-3b` hervor — überwachtes LoRA-Feintuning auf einem synthetischen formallogischen Korpus, Multipfad-Destillation, Checkpoint-Fusion, eine WiSE-FT-Interpolation zurück zur vortrainierten Basis und eine entropiegewichtete GRPO-Phase gegen einen programmatischen Verifizierer. Seine Zielausgaben sind Objekte statt Prosa: Übersetzungen in Prädikatenlogik erster Stufe, Entailment-Labels, semantische Parses, Lean-Aussagen und Lean-Beweiskritiken. webAI stellt klar, dass das Modell kein allgemeiner Assistent ist und keine Sicherheits- oder Präferenzabstimmung über das hinaus aufweist, was Granite 4.2 besaß.

Gemma 4 12B ist die entgegengesetzte Konstruktion. Es ist das dichte Mitglied der Gemma-4-Familie mit 11,95 Mrd. Parametern – 48 Schichten, ein Vokabular von 262K, ein Kontextfenster von 256K Token – und es ist nativ multimodal: Es verarbeitet Text, Bild und Audio über eine encoderfreie Architektur, statt separate Vision- und Audio-Türme anzuflanschen. Alle Gemma-4-Modelle werden mit konfigurierbaren Denkmodi, nativer System-Prompt-Unterstützung und Funktionsaufrufen ausgeliefert. Es ist als allgemeines Arbeitstier für Reasoning und multimodale Aufgaben in einer Größe konzipiert, die auf eine Consumer-GPU passt.

TwIL-LM3-Pro zu bitten, ein Foto zu beschreiben, ist kein fairer Test, und es ist kein Test, für den das Modell gebaut wurde. Gemma 4 12B zu bitten, eine semantische Analyse in einem festen Schema auszugeben, ist ebenfalls nicht die Aufgabe, für die es optimiert wurde. Die Überschneidung ist real, aber klein: Beide können logisch schlussfolgern, und beide können offline laufen.

Die Dimensionen, die sich tatsächlich unterscheiden

• Parameter — TwIL-LM3-Pro 3.66B dense vs. Gemma 4 12B 11.95B dense, ein Faktor von ungefähr 3,3.

• Kontextfenster — TwIL-LM3-Pro 131.072 Tokens, unverändert von seiner Granite-Basis übernommen; Gemma 4 12B 256.000 Tokens.

• Modalitäten in — TwIL-LM3-Pro nur Text; Gemma 4 12B Text, Bild, Video und Audio.

• Lizenz — webAI Non-Commercial License Version 1.0 vs. Apache 2.0.

• Basismodell — `ibm-granite/granite-4.2-3b` vs. Googles eigenes Gemma-4-Pretraining, veröffentlicht zusammen mit einem technischen Bericht.

• Denkformat — TwIL-LM3-Pro gibt standardmäßig vor der Antwort einen `<think>`-Block aus; Gemma 4 bietet über die gesamte Familie hinweg konfigurierbare Denkmodi.

• Quantisierter Speicherbedarf — TwIL-LM3-Pro Q4_K_M mit 2,09 GiB, läuft auf CPU oder 4 GB VRAM; Gemma 4 12B in bf16 belegt rund 24 GiB und ist eher für eine Consumer-GPU als für die integrierte Grafik eines Laptops ausgelegt.

Diese letzte Zeile ist diejenige, die die Darstellung „beide laufen lokal“ am schärfsten untergräbt, und es lohnt sich, hier präzise zu sein. Der lokale Anspruch von TwIL-LM3-Pro ist ein Laptop-Anspruch. Der lokale Anspruch von Gemma 4 12B ist ein Workstation-GPU-Anspruch, wobei Googles kleinere Modelle E2B und E4B die tatsächliche Telefon-und-Laptop-Klasse bedienen. Zwei Modelle, die beide als lokal bezeichnet werden, sind nicht dieselbe Hardware-Messlatte.

Wo die Benchmark-Evidenz steht

Jede Leistungskennzahl für TwIL-LM3-Pro stammt aus webAIs eigener Modellkarte und wurde auf den unternehmenseigenen Track-A- und Track-B-Testumgebungen gemessen. Eine unabhängige Evaluierung liegt noch nicht vor. Der Vergleich, den die Karte selbst hervorhebt, richtet sich gegen Qwen3-8B, nicht gegen ein Gemma-Modell – webAIs Makro-Gate von 0.5539 gegenüber Qwen3-8B mit 0.5336, mit einem Vorsprung, den die Karte als innerhalb des Stichprobenrauschens beschreibt, und strict-7 von 0.2879 gegenüber 0.2093, wo die Lücke nicht von Gutschriften für lose Übereinstimmungen abhängt. Gegenüber der eigenen Basis Granite 4.2 3B steigt das In-Domain-Makro-Gate von 0.4313 auf 0.5539, während das Makro über die 10 zurückgehaltenen Datensätze mit 0.7901 gegenüber 0.7942 konstant bleibt.

Gemma 4 12B verfügt über einen veröffentlichten technischen Bericht und über eine breite Basis an Bewertungen durch Dritte. Es hat außerdem eine vom Anbieter gemeldete Benchmark-Position innerhalb seiner eigenen Familie – Goog​le stuft den 12B Unified Build in seinen eigenen Reasoning- und Coding-Tabellen unter dem 31B und dem 26B A4B ein. Diese Einstufung ist Goog​les eigene, und es lohnt sich, sie als solche zu zitieren.

Die ehrliche Aussage über einen direkten Kopf-an-Kopf-Vergleich ist, dass es keinen gibt. Niemand hat TwIL-LM3-Pro und Gemma 4 12B durch eine gemeinsame Testumgebung laufen lassen und das Ergebnis veröffentlicht. Die beiden wurden nie von irgendjemandem nach demselben Bewertungsraster bewertet, weil die Bewertungsraster, nach denen sie bewertet werden, sich nicht überschneiden. Eine Genauigkeit bei formal-logischer Implikation und ein MMLU-Pro-Prozentwert sind nicht dieselbe Einheit.

Wann jede einzelne die richtige Wahl ist

Greifen Sie zu TwIL-LM3-Pro, wenn die Ausgabe, die Sie benötigen, eine maschinenprüfbare Struktur ist – ein Entailment-Label, ein Lean-Statement, ein semantischer Parse – und es sich um eine Batch- oder Offline-Arbeitslast handelt und die Lizenz keine Einschränkung für das darstellt, was Sie mit dem Ergebnis tun. Sein 2,09 GiB quantisierter Build, der auf der CPU ohne Netzwerkabhängigkeit läuft, ist ein echter Vorteil für eine air-gapped Pipeline oder einen Labeling-Durchlauf, der auf einem Laptop laufen muss.

Greifen Sie zu Gemma 4 12B, wenn Sie ein allgemeines Modell benötigen, das Sie ausliefern können, wenn die Eingabe kein Text ist, wenn der Kontext lang ist oder wenn Sie feinabstimmen und weiterverbreiten möchten. Apache 2.0 plus native Multimodalität plus ein 256K-Fenster ist eine Kombination, die keiner der eng fokussierten Spezialisten bietet.

Die beiden können auch koexistieren. Eine Pipeline, die Gemma 4 12B nutzt, um eine gemischtmodale Eingabe zu lesen und zu normalisieren, und dann eine strukturierte Aussage an einen Spezialisten für formale Logik weitergibt, ist eine vernünftige Arbeitsteilung, und sie hat dieselbe Form wie die Nutzung eines Frontier-Modells zum Entwerfen und eines kleinen Modells zum Verifizieren.

Bereitstellung eines von beiden über einen einzigen Endpunkt

Weder TwIL-LM3-Pro noch der Gemma 4 12B Unified build ist derzeit eine Route im OrcaRouter-Katalog, und das sollte man vor der Empfehlung erwähnen und nicht danach. Was aus derselben Familie geroutet wird, sind die größeren Gemma-4-Tiers — `gemma-4-26b-a4b-it` und `gemma-4-31b-it` —, sodass das übliche Muster hier darin besteht, einen Prototyp des Prompts und des Schemas gegen ein gehostetes Gemma-4-Tier über einen OpenAI-kompatiblen Endpunkt zum Listenpreis des Anbieters mit 0 % Aufschlag zu erstellen, und dann die festgelegte Workload auf den 12B-Checkpoint auf Ihrer eigenen Hardware zu verlagern. Derselbe Endpunkt bedient über 200 Modelle, sodass das Frontier-Modell, das Sie zur Generierung von Evaluierungsdaten verwenden, und das kleine Modell, mit dem Sie diese prüfen, nur einen Schlüssel und ein Anfrageformat voneinander entfernt sind, mit automatischem Failover, falls ein Anbieter mitten im Lauf instabil wird.

Das ist eine schwächere Version der Routing-Story als üblich, und sie sollte auch so dargestellt werden: Wir hosten das Modell, das Sie vergleichen, nicht, daher ist die ehrliche Empfehlung ein Workflow und kein Wechsel.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Gemma 4 12B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Context 131,072 tokens; Input text only; Licence non-commercial; Base granite-4.2-3b; Quantised size 2.09 GiB Q4_K_M. Gemma 4 12B: Parameters 11.95B dense; Context 256,000 tokens; Input text, image, audio; Licence Apache 2.0; Base Google Gemma 4 pretraining; Quantised size about 24 GiB in bf16. A footer line reads 'Gemma figures per Google model card; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

Die Entscheidungsregel

Wenn das Ergebnis kommerziell einsetzbar sein muss, beantwortet die Lizenz die Frage, bevor es irgendein Benchmark tut, und sie verweist auf Gemma 4 12B. Wenn das Ergebnis eine offline erzeugte und intern genutzte formallogische Ausgabe ist, ist TwIL-LM3-Pro das stärkere Werkzeug bei einem Drittel der Größe. Wenn Sie beides brauchen, besteht die interessante Ingenieursleistung nicht darin, einen Sieger zu küren — sondern darin, die Schnittstelle zu definieren, an der ein allgemeines multimodales Modell aufhört und ein Spezialist für formale Logik beginnt.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, dated 2026-04-02, showing the 30.7B dense multimodal description, a 256K token context window, the $0.13 input and $0.38 output rate, and the OrcaRouter chrome with Code samples, Pricing, Performance, Public benchmarks and FAQ sections.A screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing the Google author line, the Any-to-Any, Transformers, Safetensors and gemma4_unified tags, the Apache 2.0 licence badge, and the opening text describing the Gemma 4 12B Unified model as part of the Gemma 4 family with native audio and vision understanding and no separate encoders.