Een gegenereerde titelkaart met als kop 'TwIL-LM3-Pro vs Gemma 4 12B', met als ondertitel 'Twee lokale modellen, twee licenties', met twee afgeronde kaarten met de tekst 'TwIL-LM3-Pro - Niet-commercieel' en 'Gemma 4 12B - Apache 2.0'. Een voettekstregel luidt: 'Licentie bepaalt meer implementaties dan welke benchmarkrij dan ook.' Het OrcaRouter-logo is in de rechteronderhoek samengesteld.
Guides & Insights

TwIL-LM3-Pro vs Gemma 4 12B: Twee lokale modellen die niets gemeen hebben behalve de laptop

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet TwIL-LM3-Pro en Gemma 4 12B naast elkaar en de overeenkomsten zijn echt maar oppervlakkig: beide zijn open checkpoints die je vandaag kunt downloaden, beide draaien op consumentenhardware zonder cloudaccount, en beide beantwoorden vragen offline. Alles daarna loopt uiteen, en de scherpste divergentie is juridisch in plaats van technisch. TwIL-LM3-Pro, webAI's specialist in formele logica van 3,66B, wordt uitgebracht onder de webAI Non-Commercial License ver. 1.0 — je mag ermee onderzoeken en je mag er geen bedrijf op bouwen zonder afzonderlijke overeenkomst. Gemma 4 12B, het encoder-vrije multimodale model van Goog​le DeepMind, wordt uitgebracht onder Apache 2.0. Die ene regel bepaalt meer implementaties dan de benchmarktabel zal doen, dus het loont de moeite om daar te beginnen in plaats van daar te eindigen.

Dit is een vergelijking tussen een specialist en een generalist die toevallig hetzelfde soort object zijn. TwIL-LM3-Pro doet één taak — formele logica — en doet die beter dan modellen die meerdere keren zo groot zijn. Gemma 4 12B doet veel taken, ziet en hoort én leest, en is er bewust op gebouwd om het standaard kleine model te zijn in het product van iemand anders. Hun specsheets naast elkaar lezen alsof ze voor dezelfde plek concurreren, is de fout die deze pagina wil voorkomen.

De licentie is de eerste specificatie.

De licentie van TwIL-LM3-Pro staat reproductie, onderzoek en persoonlijk gebruik toe, en vereist uitdrukkelijk een aparte overeenkomst met webAI voor een uitrol die inkomsten genereert. Ook beperkt deze het gebruik van webAI's handelsnamen en merken zonder schriftelijke toestemming. Voor een hobbyist, een promovendus of een interne onderzoeksgroep is dat een volledige toestemming. Voor iedereen die een product op de markt brengt, is het een harde stop totdat er een overeenkomst bestaat — en webAI's commerciële route is een enterprise-regeling, niet een gepubliceerde tariefkaart.

Gemma 4 12B is Apache 2.0. Je kunt het fine-tunen, het afgeleide werk herdistribueren, het aan klanten leveren en het in een commercieel product verwerken, met inachtneming van Google's gebruiksbeleid. Dat is geen klein gradueel verschil; het is het verschil tussen een model dat je kunt evalueren en een model waarop je kunt voortbouwen.

Beide zijn downloads zonder toegangsbeperking op Hugging Face, dus de licentie is de enige drempel, en het is er echt een.

Waar elk model eigenlijk voor is

TwIL-LM3-Pro stamt af van `ibm-granite/granite-4.2-3b` via een pijplijn in vijf fasen — LoRA-gesuperviseerde fine-tuning op een synthetisch corpus van formele logica, multipath-distillatie, checkpointfusie, een WiSE-FT-interpolatie terug naar de vooraf getrainde basis, en een entropiegewogen GRPO-fase tegen een programmatische verifier. De beoogde uitvoer bestaat uit objecten in plaats van proza: vertalingen naar de eerste-orde logica, entailment-labels, semantische parses, Lean-verklaringen en Lean-bewijskritieken. webAI stelt duidelijk dat het model geen algemene assistent is en geen veiligheids- of voorkeurstuning bevat die verder gaat dan wat Granite 4.2 had.

Gemma 4 12B is de tegenovergestelde constructie. Het is het dense lid van de Gemma 4-familie met 11,95 miljard parameters — 48 lagen, een vocabulaire van 262K, een contextvenster van 256K tokens — en het is native multimodaal: het verwerkt tekst, beeld en audio via een encoderloze architectuur in plaats van afzonderlijke vision- en audiotorens eraan vast te schroeven. Alle Gemma 4-modellen worden geleverd met configureerbare denkmodi, native ondersteuning voor systeemprompts en functieaanroepen. Het is ontworpen als een algemeen werkpaard voor redeneren en multimodale taken, in een formaat dat op een consumenten-GPU past.

Aan TwIL-LM3-Pro vragen om een foto te beschrijven is geen eerlijke test, en het is geen test waarvoor het model is gebouwd. Aan Gemma 4 12B vragen om een semantische parse in een vast schema te produceren is ook niet de taak waarvoor het is afgestemd. De overlap is reëel maar smal: beide kunnen redeneren, en beide kunnen offline draaien.

De dimensies die daadwerkelijk verschillen

• Parameters — TwIL-LM3-Pro 3,66B dense vs Gemma 4 12B 11,95B dense, een factor van ongeveer 3,3.

• Contextvenster — TwIL-LM3-Pro 131.072 tokens, ongewijzigd overgenomen van zijn Granite-basis; Gemma 4 12B 256.000 tokens.

• Modaliteiten in — TwIL-LM3-Pro alleen tekst; Gemma 4 12B tekst, afbeelding, video en audio.

• Licentie — webAI Non-Commercial License ver. 1.0 vs Apache 2.0.

• Basismodel — `ibm-granite/granite-4.2-3b` vs Goog​le's eigen pretraining van Gemma 4, gepubliceerd samen met een technisch rapport.

• Denkformaat — TwIL-LM3-Pro zendt standaard een `<think>`-blok uit voordat het antwoordt; Gemma 4 biedt configureerbare denkmodi binnen de hele familie.

• Gekwantiseerde voetafdruk — TwIL-LM3-Pro Q4_K_M op 2,09 GiB, draait op CPU of 4 GB VRAM; Gemma 4 12B in bf16 is ongeveer 24 GiB, qua omvang bedoeld voor een consumenten-GPU in plaats van de geïntegreerde graphics van een laptop.

Die laatste regel is degene die de framing "beide draaien lokaal" het scherpst ondermijnt, en het is de moeite waard om daar precies over te zijn. De lokale claim van TwIL-LM3-Pro is een laptopclaim. De lokale claim van Gemma 4 12B is een workstation-GPU-claim, waarbij de kleinere E2B- en E4B-modellen van Google de categorie bedienen die echt voor telefoons en laptops is bedoeld. Twee modellen die beide lokaal worden genoemd, zijn niet dezelfde hardwarelat.

Waar het benchmarkbewijs staat

Elk prestatiecijfer voor TwIL-LM3-Pro komt uit webAI's eigen modelkaart, gemeten op de eigen Track A- en Track B-harnassen van het bedrijf. Er bestaat nog geen onafhankelijke evaluatie. De vergelijking die de kaart zelf benadrukt, is met Qwen3-8B, niet met een Gemma-model — webAI's macro-gate van 0.5539 tegenover Qwen3-8B's 0.5336, met een voorsprong die de kaart omschrijft als binnen de steekproefruis, en strict-7 van 0.2879 tegenover 0.2093, waar het verschil niet afhangt van loose-match-credit. Tegenover zijn eigen Granite 4.2 3B-basis stijgt de in-domain macro-gate van 0.4313 naar 0.5539, terwijl de held-out 10-dataset-macro gelijk blijft op 0.7901 tegenover 0.7942.

Gemma 4 12B heeft een gepubliceerd technisch rapport en een brede verzameling evaluaties door derden. Het heeft ook een door de leverancier gerapporteerde benchmarkpositie binnen zijn eigen familie — Google rangschikt de 12B Unified-build onder de 31B en 26B A4B op zijn eigen tabellen voor redeneervermogen en codeervaardigheden. Die rang is van Google, en het is de moeite waard om die als zodanig te citeren.

De eerlijke vaststelling over een rechtstreekse onderlinge vergelijking is dat die er niet is. Niemand heeft TwIL-LM3-Pro en Gemma 4 12B door een gedeelde testomgeving laten lopen en het resultaat gepubliceerd. De twee zijn nooit door iemand met hetzelfde beoordelingskader gescoord, omdat de beoordelingskaders waarmee ze worden gescoord niet overlappen. Een nauwkeurigheid voor formeel-logische entailment en een MMLU-Pro-percentage zijn niet dezelfde eenheid.

Wanneer elk ervan de juiste keuze is

Kies TwIL-LM3-Pro wanneer de output die je nodig hebt een machinecontroleerbare structuur is — een entailmentlabel, een Lean-statement, een semantische parse — en de workload batch of offline is, en de licentie geen beperking vormt op wat je met het resultaat doet. De gekwantiseerde build van 2,09 GiB die op de CPU draait zonder netwerkafhankelijkheid is een echt voordeel voor een air-gapped pipeline of een labelronde die op een laptop moet draaien.

Kies voor Gemma 4 12B wanneer je een algemeen model nodig hebt dat je kunt uitbrengen, wanneer de invoer geen tekst is, wanneer de context lang is, of wanneer je wilt fine-tunen en herdistribueren. Apache 2.0 plus native multimodaliteit plus een 256K-venster is een combinatie die geen van de gespecialiseerde modellen biedt.

De twee kunnen ook naast elkaar bestaan. Een pipeline die Gemma 4 12B gebruikt om een invoer met gemengde modaliteit te lezen en te normaliseren en vervolgens een gestructureerde bewering aan een specialist in formele logica overhandigt, is een redelijke taakverdeling, en het heeft dezelfde vorm als het gebruiken van een frontier-model om te schetsen en een klein model om te verifiëren.

Een van beide vanaf één endpoint serveren

Noch TwIL-LM3-Pro noch de Gemma 4 12B Unified build is momenteel een route in de OrcaRouter-catalogus, en dat is het vermelden waard vóór de aanbeveling in plaats van erna. Wat uit dezelfde familie wel wordt gerouteerd, zijn de grotere Gemma 4-tiers — `gemma-4-26b-a4b-it` en `gemma-4-31b-it` — dus het gebruikelijke patroon hier is om de prompt en het schema te prototypen tegen een gehoste Gemma 4-tier via een OpenAI-compatibel endpoint tegen de lijstprijs van de provider met 0% markup toegevoegd, en verplaats daarna de uitgekristalliseerde workload naar het 12B-checkpoint op je eigen hardware. Hetzelfde endpoint bedient meer dan 200 modellen, dus het frontier-model dat je gebruikt om evaluatiegegevens te genereren en het kleine model dat je gebruikt om die te controleren, zijn slechts één sleutel en één aanvraagformaat van elkaar verwijderd, met automatische failover als een provider tijdens de run hapert.

Dat is een zwakkere versie van het routingverhaal dan gewoonlijk, en dat moet ook zo worden gebracht: we hosten het model dat je aan het vergelijken bent niet, dus het eerlijke advies is een workflow in plaats van een schakelaar.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Gemma 4 12B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Context 131,072 tokens; Input text only; Licence non-commercial; Base granite-4.2-3b; Quantised size 2.09 GiB Q4_K_M. Gemma 4 12B: Parameters 11.95B dense; Context 256,000 tokens; Input text, image, audio; Licence Apache 2.0; Base Google Gemma 4 pretraining; Quantised size about 24 GiB in bf16. A footer line reads 'Gemma figures per Google model card; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

De beslissingsregel

Als het deliverable commercieel inzetbaar moet zijn, beantwoordt de licentie de vraag nog vóór welke benchmark dan ook, en die wijst naar Gemma 4 12B. Als het deliverable een offline geproduceerde formal-logic-uitvoer is die intern wordt gebruikt, is TwIL-LM3-Pro het sterkere instrument, bij een derde van de omvang. Als je beide nodig hebt, zit de interessante engineering niet in het kiezen van een winnaar — maar in het definiëren van de interface waar een algemeen multimodaal model ophoudt en een formal-logic-specialist begint.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, dated 2026-04-02, showing the 30.7B dense multimodal description, a 256K token context window, the $0.13 input and $0.38 output rate, and the OrcaRouter chrome with Code samples, Pricing, Performance, Public benchmarks and FAQ sections.A screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing the Google author line, the Any-to-Any, Transformers, Safetensors and gemma4_unified tags, the Apache 2.0 licence badge, and the opening text describing the Gemma 4 12B Unified model as part of the Gemma 4 family with native audio and vision understanding and no separate encoders.