
TwIL-LM3-Pro kontra Gemma 4 12B: Dwa lokalne modele, które nie mają ze sobą nic wspólnego poza laptopem
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 219 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Zestaw TwIL-LM3-Pro i Gemma 4 12B obok siebie, a podobieństwa są prawdziwe, choć powierzchowne: oba to otwarte checkpointy, które możesz pobrać już dziś, oba działają na sprzęcie konsumenckim bez konta w chmurze i oba odpowiadają na pytania offline. Wszystko poza tym się rozchodzi, a najostrzejsza rozbieżność ma charakter prawny, a nie techniczny. TwIL-LM3-Pro, specjalista od logiki formalnej o 3,66 mld parametrów od webAI, jest udostępniany na licencji webAI Non-Commercial License wer. 1.0 — możesz prowadzić z nim badania, ale nie możesz bez odrębnej umowy zbudować na nim biznesu. Gemma 4 12B, pozbawiony enkodera model multimodalny od Google DeepMind, jest udostępniany na licencji Apache 2.0. Ta jedna linijka decyduje o większej liczbie wdrożeń niż tabela benchmarków, więc warto zacząć od niej, a nie kończyć na niej.
To porównanie specjalisty i generalisty, które przypadkiem są tym samym rodzajem obiektu. TwIL-LM3-Pro wykonuje jedno zadanie — logikę formalną — i robi to lepiej niż modele kilkukrotnie większe. Gemma 4 12B wykonuje wiele zadań, widzi i słyszy równie dobrze, jak czyta, i została celowo stworzona, by być domyślnym małym modelem w produkcie kogoś innego. Czytanie ich specyfikacji jedna przeciw drugiej, tak jakby konkurowały o to samo miejsce, to błąd, któremu ta strona ma zapobiegać.
Licencja jest pierwszą specyfikacją
Licencja TwIL-LM3-Pro pozwala na reprodukcję, badania i użytek osobisty, a wprost wymaga odrębnej umowy z webAI w przypadku wdrożeń generujących przychody. Ogranicza również używanie nazw handlowych i znaków webAI bez pisemnej zgody. Dla hobbysty, doktoranta albo wewnętrznej grupy badawczej to pełne pozwolenie. Dla każdego, kto wprowadza produkt na rynek, to twarda blokada, dopóki nie istnieje umowa — a komercyjna ścieżka webAI to uzgodnienie klasy enterprise, a nie opublikowany cennik.
Gemma 4 12B jest objęta licencją Apache 2.0. Możesz ją dostrajać, redystrybuować dzieło pochodne, udostępniać ją klientom i wbudowywać ją w produkt komercyjny, z zastrzeżeniem polityki użytkowania Google. To nie jest niewielka różnica stopnia; to różnica między modelem, który możesz ocenić, a modelem, na którym możesz budować.
Oba są nieograniczonymi pobraniami na Hugging Face, więc licencja jest jedyną bramką — i to nie byle jaką.
Do czego tak naprawdę służy każdy model
TwIL-LM3-Pro wywodzi się od `ibm-granite/granite-4.2-3b` poprzez pięcioetapowy potok — nadzorowane dostrajanie LoRA na syntetycznym korpusie logiki formalnej, destylację wielościeżkową, fuzję punktów kontrolnych, interpolację WiSE-FT z powrotem w kierunku wstępnie wytrenowanej bazy oraz etap GRPO ważony entropią wobec programowego weryfikatora. Jego docelowymi wynikami są obiekty, a nie proza: tłumaczenia na logikę pierwszego rzędu, etykiety wynikania, parsowania semantyczne, zdania Lean i krytyki dowodów Lean. webAI stwierdza wprost, że model nie jest ogólnym asystentem i nie ma dostrajania bezpieczeństwa ani preferencji poza tym, które miał Granite 4.2.
Gemma 4 12B to konstrukcja odwrotna. Jest gęstym członkiem rodziny Gemma 4 o 11,95 mld parametrów — 48 warstw, słownik 262 tys., okno kontekstowe 256 tys. tokenów — i jest natywnie multimodalny, obsługując tekst, obraz i dźwięk dzięki architekturze bez enkodera, zamiast doczepiać osobne wieże wizji i dźwięku. Wszystkie modele Gemma 4 są dostarczane z konfigurowalnymi trybami myślenia, natywną obsługą promptu systemowego i wywoływaniem funkcji. Został zaprojektowany jako uniwersalny koń roboczy do rozumowania i zadań multimodalnych w rozmiarze mieszczącym się na konsumenckiej karcie graficznej.
Proszenie TwIL-LM3-Pro o opisanie zdjęcia nie jest sprawiedliwym testem i nie jest to test, do którego model został stworzony. Proszenie Gemma 4 12B o wygenerowanie parsowania semantycznego w ustalonym schemacie również nie jest zadaniem, do którego została dostrojona. Część wspólna jest realna, ale wąska: oba potrafią rozumować i oba mogą działać offline.
Wymiary, które faktycznie się różnią
• Parametry — TwIL-LM3-Pro 3,66B gęsty vs Gemma 4 12B 11,95B gęsty, współczynnik około 3,3.
• Okno kontekstowe — TwIL-LM3-Pro 131 072 tokeny, odziedziczone bez zmian z jego bazowego modelu Granite; Gemma 4 12B 256 000 tokenów.
• Modalności wejściowe — TwIL-LM3-Pro tylko tekst; Gemma 4 12B tekst, obraz, wideo i audio.
• Licencja — webAI Non-Commercial License wer. 1.0 vs Apache 2.0.
• Model bazowy — `ibm-granite/granite-4.2-3b` vs własny pretrening Gemma 4 Google'a, opublikowany wraz z raportem technicznym.
• Format myślenia — TwIL-LM3-Pro domyślnie emituje blok `<think>` przed udzieleniem odpowiedzi; Gemma 4 udostępnia konfigurowalne tryby myślenia w całej rodzinie.
• Skwantyzowana zajętość pamięci — TwIL-LM3-Pro Q4_K_M przy 2,09 GiB, działający na CPU lub 4 GB VRAM; Gemma 4 12B w bf16 to około 24 GiB, przewidziany dla konsumenckiego GPU, a nie dla zintegrowanej grafiki laptopa.
Ta ostatnia linijka najmocniej podważa ujęcie „oba działają lokalnie” i warto być co do tego precyzyjnym. Deklaracja lokalności TwIL-LM3-Pro dotyczy laptopa. Deklaracja lokalności modelu Gemma 4 12B dotyczy stacji roboczej z GPU, przy czym mniejsze modele E2B i E4B firmy Google obsługują rzeczywisty poziom telefonów i laptopów. Dwa modele, oba nazywane lokalnymi, to nie ta sama poprzeczka sprzętowa.
Jaki jest stan dowodów benchmarkowych
Każdy wynik wydajności dla TwIL-LM3-Pro pochodzi z karty modelu samego webAI, mierzony na własnych środowiskach testowych Track A i Track B firmy. Nie istnieje jeszcze żadna niezależna ocena. Porównanie, które sama karta podkreśla, dotyczy Qwen3-8B, a nie jakiegokolwiek modelu Gemma — macro gate webAI wynoszący 0,5539 wobec 0,5336 dla Qwen3-8B, z przewagą, którą karta opisuje jako mieszczącą się w szumie próbkowania, oraz strict-7 na poziomie 0,2879 wobec 0,2093, gdzie różnica nie zależy od punktów za luźne dopasowanie. W porównaniu z własną bazą Granite 4.2 3B macro gate w domenie wzrasta z 0,4313 do 0,5539, podczas gdy makro dla 10 odłożonych zbiorów danych utrzymuje się na poziomie 0,7901 wobec 0,7942.
Gemma 4 12B ma opublikowany raport techniczny oraz obszerny zestaw ocen zewnętrznych. Zajmuje także pozycję w benchmarkach raportowaną przez dostawcę w obrębie własnej rodziny — Google klasyfikuje wersję 12B Unified poniżej 31B i 26B A4B we własnych tabelach rozumowania i kodowania. Ten ranking pochodzi od Google i warto go jako taki cytować.
Uczciwe stwierdzenie na temat bezpośredniego starcia jeden na jeden jest takie, że nie ma takiego starcia. Nikt nie przepuścił TwIL-LM3-Pro i Gemma 4 12B przez wspólny harness i nie opublikował wyniku. Nigdy nie oceniano ich według tego samego zestawu kryteriów, ponieważ kryteria, według których się je ocenia, nie pokrywają się. Dokładność wynikania w logice formalnej i wynik procentowy MMLU-Pro to nie ta sama jednostka.
Kiedy każdy z nich jest właściwym wyborem
Sięgaj po TwIL-LM3-Pro, gdy potrzebujesz wyniku w postaci struktury weryfikowalnej maszynowo — etykiety wynikania, wyrażenia w Lean, analizy semantycznej — a obciążenie jest wsadowe lub offline i licencja nie ogranicza tego, co robisz z wynikiem. Jego skwantyzowana kompilacja o rozmiarze 2,09 GiB działająca na CPU bez zależności sieciowej jest prawdziwą zaletą w przypadku potoku odizolowanego od sieci lub przebiegu etykietowania, który musi działać na laptopie.
Sięgnij po Gemma 4 12B, gdy potrzebujesz ogólnego modelu, który możesz wdrożyć, gdy dane wejściowe nie są tekstem, gdy kontekst jest długi albo gdy musisz dostroić model i go redystrybuować. Apache 2.0 wraz z natywną multimodalnością i oknem 256K to kombinacja, której nie oferuje żaden z wąskich specjalistów.
Te dwa podejścia mogą również współistnieć. Potok przetwarzania, który wykorzystuje model Gemma 4 12B do odczytania i normalizacji danych wejściowych o mieszanej modalności, a następnie przekazuje ustrukturyzowane zdanie specjaliście od logiki formalnej, to rozsądny podział pracy — ma on ten sam kształt co użycie modelu frontier do tworzenia szkicu i małego modelu do weryfikacji.
Udostępnianie któregokolwiek z nich z jednego punktu końcowego
Ani TwIL-LM3-Pro, ani kompilacja Gemma 4 12B Unified nie jest obecnie trasą w katalogu OrcaRouter i warto to powiedzieć przed rekomendacją, a nie po niej. Z tej samej rodziny trasowane są większe warianty Gemma 4 — `gemma-4-26b-a4b-it` i `gemma-4-31b-it` — więc typowy schemat działania polega tu na prototypowaniu promptu i schematu na hostowanym wariancie Gemma 4 przez endpoint zgodny z OpenAI, w cenie katalogowej dostawcy, z dodaną marżą 0%, a następnie przeniesieniu ustabilizowanego obciążenia na checkpoint 12B na własnym sprzęcie. Ten sam endpoint obsługuje ponad 200 modeli, więc model frontier, którego używasz do generowania danych ewaluacyjnych, i mały model, którym je sprawdzasz, różni jeden klucz i jeden format żądania, z automatycznym przełączaniem awaryjnym, jeśli dostawca zachwieje się w trakcie działania.
To słabsza niż zwykle wersja historii o routingu i tak właśnie należy ją przedstawić: nie hostujemy modelu, który porównujesz, więc uczciwa rada to raczej workflow niż przełącznik.

Reguła decyzyjna
Jeśli produkt ma być komercyjnie wdrożalny, licencja odpowiada na to pytanie, zanim zrobi to jakikolwiek benchmark, i wskazuje na Gemma 4 12B. Jeśli produkt jest wynikiem formalno-logicznym generowanym offline i wykorzystywanym wewnętrznie, TwIL-LM3-Pro jest silniejszym narzędziem, mając jedną trzecią rozmiaru. Jeśli potrzebujesz obu, ciekawa inżynieria nie polega na wybieraniu zwycięzcy — polega na zdefiniowaniu interfejsu, w którym kończy się ogólny model multimodalny, a zaczyna specjalista od logiki formalnej.


