Ett genererat titelkort med rubriken 'TwIL-LM3-Pro vs Gemma 4 12B', med underrubriken 'Två lokala modeller, två licenser', och två rundade kort där det står 'TwIL-LM3-Pro - Icke-kommersiell' och 'Gemma 4 12B - Apache 2.0'. En sidfotsrad lyder 'Licens avgör fler driftsättningar än någon benchmarkrad.' OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

TwIL-LM3-Pro vs Gemma 4 12B: Två lokala modeller med inget gemensamt utom laptopen

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ställ TwIL-LM3-Pro och Gemma 4 12B sida vid sida och likheterna är verkliga men ytliga: båda är öppna checkpoints som du kan ladda ner idag, båda körs på konsumenthårdvara utan ett molnkonto, och båda svarar på frågor offline. Allt därefter skiljer sig, och den skarpaste skillnaden är juridisk snarare än teknisk. TwIL-LM3-Pro, webAIs 3,66B-specialist på formell logik, släpps under webAI Non-Commercial License ver. 1.0 – du får forska med den och du får inte bygga ett företag på den utan ett separat avtal. Gemma 4 12B, Goog​le DeepMinds encoderfria multimodala modell, släpps under Apache 2.0. Den enda raden avgör fler driftsättningar än benchmarktabellen kommer att göra, så det är värt att börja där i stället för att sluta där.

Det här är en jämförelse mellan en specialist och en generalist som råkar vara samma typ av objekt. TwIL-LM3-Pro utför ett enda jobb – formell logik – och gör det bättre än modeller som är flera gånger så stora som den. Gemma 4 12B utför många jobb, ser och hör lika bra som den läser, och är medvetet byggd för att vara den förvalda lilla modellen i någon annans produkt. Att läsa deras specifikationsblad mot varandra som om de tävlade om samma plats är det misstag som den här sidan är till för att förhindra.

Licensen är den första specifikationen.

Licensen för TwIL-LM3-Pro tillåter reproduktion, forskning och personligt bruk och kräver uttryckligen ett separat avtal med webAI för intäktsgenererande driftsättning. Den begränsar också användningen av webAI:s varunamn och varumärken utan skriftligt medgivande. För en hobbyist, en doktorand eller en intern forskningsgrupp är det ett fullständigt tillstånd. För den som släpper en produkt är det ett tvärstopp tills ett avtal finns — och webAI:s kommersiella väg är en företagsöverenskommelse, inte en publicerad prislista.

Gemma 4 12B är Apache 2.0. Du kan finjustera den, vidaredistribuera derivatet, tillhandahålla den till kunder och leverera den inuti en kommersiell produkt, med förbehåll för Googles användningspolicy. Det är inte en liten gradskillnad; det är skillnaden mellan en modell som du kan utvärdera och en modell som du kan bygga vidare på.

Båda är nedladdningar utan grind på Hugging Face, så licensen är den enda grinden, och den är en riktig sådan.

Vad varje modell egentligen är till för

TwIL-LM3-Pro härstammar från `ibm-granite/granite-4.2-3b` genom en femstegspipeline — LoRA-övervakad finjustering på ett syntetiskt corpus för formell logik, flervägsdestillation, checkpoint-fusion, en WiSE-FT-interpolering tillbaka mot den förtränade basmodellen, och ett entropivägt GRPO-steg mot en programmatisk verifierare. Dess målutdata är objekt snarare än prosa: översättningar till förstagradslogik, entailment-etiketter, semantiska parsningar, Lean-påståenden och Lean-beviskritik. webAI säger uttryckligen att modellen inte är en allmän assistent och inte har någon säkerhets- eller preferensjustering utöver vad Granite 4.2 hade.

Gemma 4 12B är den motsatta konstruktionen. Det är den täta medlemmen i Gemma 4-familjen med 11,95 miljarder parametrar – 48 lager, ett ordförråd på 262K, ett kontextfönster på 256K token – och den är nativt multimodal och hanterar text, bild och ljud genom en arkitektur utan encoder i stället för att eftermontera separata vision- och ljudtorn. Alla Gemma 4-modeller levereras med konfigurerbara tankelägen, inbyggt stöd för systemprompt och funktionsanrop. Den är utformad som en arbetshäst för allmänna resonemang och multimodalitet i en storlek som får plats på ett konsument-GPU.

Att be TwIL-LM3-Pro beskriva ett fotografi är inte ett rättvist test, och det är inte ett test som modellen är byggd för att klara. Att be Gemma 4 12B generera en semantisk parsning i ett fast schema är inte heller den uppgift den har finjusterats för. Överlappningen är verklig men smal: båda kan resonera, och båda kan köras offline.

De dimensioner som faktiskt skiljer sig

• Parametrar — TwIL-LM3-Pro 3,66B tät mot Gemma 4 12B 11,95B tät, en faktor på ungefär 3,3.

• Kontextfönster — TwIL-LM3-Pro 131 072 tokens, ärvt oförändrat från sin Granite-bas; Gemma 4 12B 256 000 tokens.

• Indatamodaliteter — TwIL-LM3-Pro endast text; Gemma 4 12B text, bild, video och ljud.

• Licens — webAI Non-Commercial License ver. 1.0 vs. Apache 2.0.

• Basmodell — `ibm-granite/granite-4.2-3b` jämfört med Googles egen Gemma 4-förträning, publicerad tillsammans med en teknisk rapport.

• Tankesformat — TwIL-LM3-Pro avger som standard ett `<think>`-block innan den svarar; Gemma 4 erbjuder konfigurerbara tankelägen över hela familjen.

• Kvantiserat minnesavtryck — TwIL-LM3-Pro Q4_K_M på 2,09 GiB, som körs på CPU eller 4 GB VRAM; Gemma 4 12B i bf16 är ungefär 24 GiB, dimensionerad för en konsument-GPU snarare än en bärbar dators integrerade grafik.

Den där sista raden är den som allra skarpast undergräver inramningen "båda körs lokalt", och det är värt att vara precis om det. TwIL-LM3-Pros anspråk på att köra lokalt är ett laptopanspråk. Gemma 4 12B:s anspråk på att köra lokalt är ett arbetsstations-GPU-anspråk, medan Goog​les mindre E2B- och E4B-modeller täcker den genuina telefon- och laptopklassen. Två modeller som båda kallas lokala har inte samma hårdvarutröskel.

Var benchmark-bevisningen står

Varje prestandasiffra för TwIL-LM3-Pro kommer från webAI:s eget modellkort och är uppmätt i företagets egna Track A- och Track B-testramverk. Ingen oberoende utvärdering finns ännu. Jämförelsen som kortet självt lyfter fram är mot Qwen3-8B, inte mot någon Gemma-modell – webAI:s makro-gate på 0,5539 mot Qwen3-8B:s 0,5336, med en ledning som kortet beskriver som inom samplingsbruset, och strict-7 på 0,2879 mot 0,2093, där gapet inte beror på poäng för lös matchning. Mot sin egen basmodell Granite 4.2 3B stiger den domäninterna makro-gaten från 0,4313 till 0,5539, medan makrot för de 10 undanhållna datauppsättningarna ligger kvar på samma nivå: 0,7901 mot 0,7942.

Gemma 4 12B har en publicerad teknisk rapport och ett brett underlag av tredjepartsutvärderingar. Den har också en av leverantören rapporterad benchmarkposition inom sin egen familj – Google rankar 12B Unified-versionen under 31B och 26B A4B i sina egna resonemangs- och kodningstabeller. Den rankningen är Googles, och den är värd att citera som sådan.

Det ärliga påståendet om en direkt jämförelse är att det inte finns någon. Ingen har kört TwIL-LM3-Pro och Gemma 4 12B genom ett gemensamt testramverk och publicerat resultatet. Ingen har någonsin poängsatt de två enligt samma bedömningsmall, eftersom bedömningsmallarna de poängsätts enligt inte överlappar varandra. En träffsäkerhet för formallogiskt entailment och en MMLU-Pro-procent är inte samma enhet.

När var och en är rätt val

Välj TwIL-LM3-Pro när det du behöver få ut är en maskinkontrollerbar struktur – en entailment-etikett, ett Lean-påstående, en semantisk parsning – och arbetsbelastningen är batch eller offline, och licensen inte är en begränsning för vad du gör med resultatet. Dess kvantiserade bygge på 2,09 GiB som körs på CPU utan nätverksberoende är en verklig fördel för en luftgapad pipeline eller en etiketteringsomgång som måste köras på en laptop.

Ta till Gemma 4 12B när du behöver en generell modell som du kan leverera, när indata inte är text, när kontexten är lång, eller när du behöver finjustera och vidaredistribuera. Apache 2.0 plus inbyggd multimodalitet plus ett 256K-fönster är en kombination som ingen av de nischade specialisterna erbjuder.

De två kan också samexistera. En pipeline som använder Gemma 4 12B för att läsa och normalisera indata med blandade modaliteter och sedan lämnar ett strukturerat påstående till en specialist på formell logik är en rimlig arbetsfördelning, och det har samma upplägg som att använda en frontmodell för att skriva ett utkast och en liten modell för att verifiera.

Serverar endera av dem från en och samma slutpunkt

Varken TwIL-LM3-Pro eller Gemma 4 12B Unified-bygget är för närvarande en rutt i OrcaRouter-katalogen, och det är värt att säga före rekommendationen snarare än efter den. Det som rutas från samma familj är de större Gemma 4-nivåerna – `gemma-4-26b-a4b-it` och `gemma-4-31b-it` – så det vanliga mönstret här är att prototypa prompten och schemat mot en hostad Gemma 4-nivå över en OpenAI-kompatibel slutpunkt till leverantörens listpris med 0 % påslag, flytta sedan den fastställda arbetsbelastningen till 12B-checkpointen på din egen hårdvara. Samma slutpunkt betjänar fler än 200 modeller, så frontiermodellen du använder för att generera utvärderingsdata och den lilla modellen du använder för att kontrollera den är bara en nyckel och ett förfrågningsformat ifrån varandra, med automatisk failover om en leverantör vacklar mitt under körningen.

Det är en svagare version av routing-berättelsen än vanligt, och det bör sägas som det är: vi hostar inte modellen du jämför med, så det ärliga rådet är ett arbetsflöde snarare än en omkoppling.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Gemma 4 12B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Context 131,072 tokens; Input text only; Licence non-commercial; Base granite-4.2-3b; Quantised size 2.09 GiB Q4_K_M. Gemma 4 12B: Parameters 11.95B dense; Context 256,000 tokens; Input text, image, audio; Licence Apache 2.0; Base Google Gemma 4 pretraining; Quantised size about 24 GiB in bf16. A footer line reads 'Gemma figures per Google model card; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

Beslutsregeln

Om slutprodukten måste vara kommersiellt driftsättningsbar svarar licensen på frågan innan något benchmark gör det, och den pekar på Gemma 4 12B. Om slutprodukten är en formallogisk utdata som produceras offline och konsumeras internt, är TwIL-LM3-Pro det starkare verktyget vid en tredjedel av storleken. Om du behöver båda är det intressanta ingenjörsarbetet inte att utse en vinnare – det är att definiera gränssnittet där en allmän multimodal modell slutar och en formallogisk specialist tar vid.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, dated 2026-04-02, showing the 30.7B dense multimodal description, a 256K token context window, the $0.13 input and $0.38 output rate, and the OrcaRouter chrome with Code samples, Pricing, Performance, Public benchmarks and FAQ sections.A screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing the Google author line, the Any-to-Any, Transformers, Safetensors and gemma4_unified tags, the Apache 2.0 licence badge, and the opening text describing the Gemma 4 12B Unified model as part of the Gemma 4 family with native audio and vision understanding and no separate encoders.