Wygenerowana karta tytułowa z nagłówkiem „TwIL-LM3-Pro vs Gemma 4 12B”, podtytułem „Dwa lokalne modele, dwie licencje”, z dwiema zaokrąglonymi kartami o treści „TwIL-LM3-Pro – Niekomercyjna” i „Gemma 4 12B – Apache 2.0”. W stopce widnieje zdanie: „Licencja decyduje o większej liczbie wdrożeń niż jakikolwiek wiersz benchmarku”. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

TwIL-LM3-Pro kontra Gemma 4 12B: Dwa lokalne modele, które nie mają ze sobą nic wspólnego poza laptopem

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Zestaw TwIL-LM3-Pro i Gemma 4 12B obok siebie, a podobieństwa są prawdziwe, choć powierzchowne: oba to otwarte checkpointy, które możesz pobrać już dziś, oba działają na sprzęcie konsumenckim bez konta w chmurze i oba odpowiadają na pytania offline. Wszystko poza tym się rozchodzi, a najostrzejsza rozbieżność ma charakter prawny, a nie techniczny. TwIL-LM3-Pro, specjalista od logiki formalnej o 3,66 mld parametrów od webAI, jest udostępniany na licencji webAI Non-Commercial License wer. 1.0 — możesz prowadzić z nim badania, ale nie możesz bez odrębnej umowy zbudować na nim biznesu. Gemma 4 12B, pozbawiony enkodera model multimodalny od Goog​le DeepMind, jest udostępniany na licencji Apache 2.0. Ta jedna linijka decyduje o większej liczbie wdrożeń niż tabela benchmarków, więc warto zacząć od niej, a nie kończyć na niej.

To porównanie specjalisty i generalisty, które przypadkiem są tym samym rodzajem obiektu. TwIL-LM3-Pro wykonuje jedno zadanie — logikę formalną — i robi to lepiej niż modele kilkukrotnie większe. Gemma 4 12B wykonuje wiele zadań, widzi i słyszy równie dobrze, jak czyta, i została celowo stworzona, by być domyślnym małym modelem w produkcie kogoś innego. Czytanie ich specyfikacji jedna przeciw drugiej, tak jakby konkurowały o to samo miejsce, to błąd, któremu ta strona ma zapobiegać.

Licencja jest pierwszą specyfikacją

Licencja TwIL-LM3-Pro pozwala na reprodukcję, badania i użytek osobisty, a wprost wymaga odrębnej umowy z webAI w przypadku wdrożeń generujących przychody. Ogranicza również używanie nazw handlowych i znaków webAI bez pisemnej zgody. Dla hobbysty, doktoranta albo wewnętrznej grupy badawczej to pełne pozwolenie. Dla każdego, kto wprowadza produkt na rynek, to twarda blokada, dopóki nie istnieje umowa — a komercyjna ścieżka webAI to uzgodnienie klasy enterprise, a nie opublikowany cennik.

Gemma 4 12B jest objęta licencją Apache 2.0. Możesz ją dostrajać, redystrybuować dzieło pochodne, udostępniać ją klientom i wbudowywać ją w produkt komercyjny, z zastrzeżeniem polityki użytkowania Google. To nie jest niewielka różnica stopnia; to różnica między modelem, który możesz ocenić, a modelem, na którym możesz budować.

Oba są nieograniczonymi pobraniami na Hugging Face, więc licencja jest jedyną bramką — i to nie byle jaką.

Do czego tak naprawdę służy każdy model

TwIL-LM3-Pro wywodzi się od `ibm-granite/granite-4.2-3b` poprzez pięcioetapowy potok — nadzorowane dostrajanie LoRA na syntetycznym korpusie logiki formalnej, destylację wielościeżkową, fuzję punktów kontrolnych, interpolację WiSE-FT z powrotem w kierunku wstępnie wytrenowanej bazy oraz etap GRPO ważony entropią wobec programowego weryfikatora. Jego docelowymi wynikami są obiekty, a nie proza: tłumaczenia na logikę pierwszego rzędu, etykiety wynikania, parsowania semantyczne, zdania Lean i krytyki dowodów Lean. webAI stwierdza wprost, że model nie jest ogólnym asystentem i nie ma dostrajania bezpieczeństwa ani preferencji poza tym, które miał Granite 4.2.

Gemma 4 12B to konstrukcja odwrotna. Jest gęstym członkiem rodziny Gemma 4 o 11,95 mld parametrów — 48 warstw, słownik 262 tys., okno kontekstowe 256 tys. tokenów — i jest natywnie multimodalny, obsługując tekst, obraz i dźwięk dzięki architekturze bez enkodera, zamiast doczepiać osobne wieże wizji i dźwięku. Wszystkie modele Gemma 4 są dostarczane z konfigurowalnymi trybami myślenia, natywną obsługą promptu systemowego i wywoływaniem funkcji. Został zaprojektowany jako uniwersalny koń roboczy do rozumowania i zadań multimodalnych w rozmiarze mieszczącym się na konsumenckiej karcie graficznej.

Proszenie TwIL-LM3-Pro o opisanie zdjęcia nie jest sprawiedliwym testem i nie jest to test, do którego model został stworzony. Proszenie Gemma 4 12B o wygenerowanie parsowania semantycznego w ustalonym schemacie również nie jest zadaniem, do którego została dostrojona. Część wspólna jest realna, ale wąska: oba potrafią rozumować i oba mogą działać offline.

Wymiary, które faktycznie się różnią

• Parametry — TwIL-LM3-Pro 3,66B gęsty vs Gemma 4 12B 11,95B gęsty, współczynnik około 3,3.

• Okno kontekstowe — TwIL-LM3-Pro 131 072 tokeny, odziedziczone bez zmian z jego bazowego modelu Granite; Gemma 4 12B 256 000 tokenów.

• Modalności wejściowe — TwIL-LM3-Pro tylko tekst; Gemma 4 12B tekst, obraz, wideo i audio.

• Licencja — webAI Non-Commercial License wer. 1.0 vs Apache 2.0.

• Model bazowy — `ibm-granite/granite-4.2-3b` vs własny pretrening Gemma 4 Goog​le'a, opublikowany wraz z raportem technicznym.

• Format myślenia — TwIL-LM3-Pro domyślnie emituje blok `<think>` przed udzieleniem odpowiedzi; Gemma 4 udostępnia konfigurowalne tryby myślenia w całej rodzinie.

• Skwantyzowana zajętość pamięci — TwIL-LM3-Pro Q4_K_M przy 2,09 GiB, działający na CPU lub 4 GB VRAM; Gemma 4 12B w bf16 to około 24 GiB, przewidziany dla konsumenckiego GPU, a nie dla zintegrowanej grafiki laptopa.

Ta ostatnia linijka najmocniej podważa ujęcie „oba działają lokalnie” i warto być co do tego precyzyjnym. Deklaracja lokalności TwIL-LM3-Pro dotyczy laptopa. Deklaracja lokalności modelu Gemma 4 12B dotyczy stacji roboczej z GPU, przy czym mniejsze modele E2B i E4B firmy Google obsługują rzeczywisty poziom telefonów i laptopów. Dwa modele, oba nazywane lokalnymi, to nie ta sama poprzeczka sprzętowa.

Jaki jest stan dowodów benchmarkowych

Każdy wynik wydajności dla TwIL-LM3-Pro pochodzi z karty modelu samego webAI, mierzony na własnych środowiskach testowych Track A i Track B firmy. Nie istnieje jeszcze żadna niezależna ocena. Porównanie, które sama karta podkreśla, dotyczy Qwen3-8B, a nie jakiegokolwiek modelu Gemma — macro gate webAI wynoszący 0,5539 wobec 0,5336 dla Qwen3-8B, z przewagą, którą karta opisuje jako mieszczącą się w szumie próbkowania, oraz strict-7 na poziomie 0,2879 wobec 0,2093, gdzie różnica nie zależy od punktów za luźne dopasowanie. W porównaniu z własną bazą Granite 4.2 3B macro gate w domenie wzrasta z 0,4313 do 0,5539, podczas gdy makro dla 10 odłożonych zbiorów danych utrzymuje się na poziomie 0,7901 wobec 0,7942.

Gemma 4 12B ma opublikowany raport techniczny oraz obszerny zestaw ocen zewnętrznych. Zajmuje także pozycję w benchmarkach raportowaną przez dostawcę w obrębie własnej rodziny — Google klasyfikuje wersję 12B Unified poniżej 31B i 26B A4B we własnych tabelach rozumowania i kodowania. Ten ranking pochodzi od Google i warto go jako taki cytować.

Uczciwe stwierdzenie na temat bezpośredniego starcia jeden na jeden jest takie, że nie ma takiego starcia. Nikt nie przepuścił TwIL-LM3-Pro i Gemma 4 12B przez wspólny harness i nie opublikował wyniku. Nigdy nie oceniano ich według tego samego zestawu kryteriów, ponieważ kryteria, według których się je ocenia, nie pokrywają się. Dokładność wynikania w logice formalnej i wynik procentowy MMLU-Pro to nie ta sama jednostka.

Kiedy każdy z nich jest właściwym wyborem

Sięgaj po TwIL-LM3-Pro, gdy potrzebujesz wyniku w postaci struktury weryfikowalnej maszynowo — etykiety wynikania, wyrażenia w Lean, analizy semantycznej — a obciążenie jest wsadowe lub offline i licencja nie ogranicza tego, co robisz z wynikiem. Jego skwantyzowana kompilacja o rozmiarze 2,09 GiB działająca na CPU bez zależności sieciowej jest prawdziwą zaletą w przypadku potoku odizolowanego od sieci lub przebiegu etykietowania, który musi działać na laptopie.

Sięgnij po Gemma 4 12B, gdy potrzebujesz ogólnego modelu, który możesz wdrożyć, gdy dane wejściowe nie są tekstem, gdy kontekst jest długi albo gdy musisz dostroić model i go redystrybuować. Apache 2.0 wraz z natywną multimodalnością i oknem 256K to kombinacja, której nie oferuje żaden z wąskich specjalistów.

Te dwa podejścia mogą również współistnieć. Potok przetwarzania, który wykorzystuje model Gemma 4 12B do odczytania i normalizacji danych wejściowych o mieszanej modalności, a następnie przekazuje ustrukturyzowane zdanie specjaliście od logiki formalnej, to rozsądny podział pracy — ma on ten sam kształt co użycie modelu frontier do tworzenia szkicu i małego modelu do weryfikacji.

Udostępnianie któregokolwiek z nich z jednego punktu końcowego

Ani TwIL-LM3-Pro, ani kompilacja Gemma 4 12B Unified nie jest obecnie trasą w katalogu OrcaRouter i warto to powiedzieć przed rekomendacją, a nie po niej. Z tej samej rodziny trasowane są większe warianty Gemma 4 — `gemma-4-26b-a4b-it` i `gemma-4-31b-it` — więc typowy schemat działania polega tu na prototypowaniu promptu i schematu na hostowanym wariancie Gemma 4 przez endpoint zgodny z OpenAI, w cenie katalogowej dostawcy, z dodaną marżą 0%, a następnie przeniesieniu ustabilizowanego obciążenia na checkpoint 12B na własnym sprzęcie. Ten sam endpoint obsługuje ponad 200 modeli, więc model frontier, którego używasz do generowania danych ewaluacyjnych, i mały model, którym je sprawdzasz, różni jeden klucz i jeden format żądania, z automatycznym przełączaniem awaryjnym, jeśli dostawca zachwieje się w trakcie działania.

To słabsza niż zwykle wersja historii o routingu i tak właśnie należy ją przedstawić: nie hostujemy modelu, który porównujesz, więc uczciwa rada to raczej workflow niż przełącznik.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Gemma 4 12B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Context 131,072 tokens; Input text only; Licence non-commercial; Base granite-4.2-3b; Quantised size 2.09 GiB Q4_K_M. Gemma 4 12B: Parameters 11.95B dense; Context 256,000 tokens; Input text, image, audio; Licence Apache 2.0; Base Google Gemma 4 pretraining; Quantised size about 24 GiB in bf16. A footer line reads 'Gemma figures per Google model card; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

Reguła decyzyjna

Jeśli produkt ma być komercyjnie wdrożalny, licencja odpowiada na to pytanie, zanim zrobi to jakikolwiek benchmark, i wskazuje na Gemma 4 12B. Jeśli produkt jest wynikiem formalno-logicznym generowanym offline i wykorzystywanym wewnętrznie, TwIL-LM3-Pro jest silniejszym narzędziem, mając jedną trzecią rozmiaru. Jeśli potrzebujesz obu, ciekawa inżynieria nie polega na wybieraniu zwycięzcy — polega na zdefiniowaniu interfejsu, w którym kończy się ogólny model multimodalny, a zaczyna specjalista od logiki formalnej.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, dated 2026-04-02, showing the 30.7B dense multimodal description, a 256K token context window, the $0.13 input and $0.38 output rate, and the OrcaRouter chrome with Code samples, Pricing, Performance, Public benchmarks and FAQ sections.A screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing the Google author line, the Any-to-Any, Transformers, Safetensors and gemma4_unified tags, the Apache 2.0 licence badge, and the opening text describing the Gemma 4 12B Unified model as part of the Gemma 4 family with native audio and vision understanding and no separate encoders.