Una card di titolo generata con intestazione «TwIL-LM3-Pro vs Gemma 4 12B», sottotitolo «Due modelli locali, due licenze», con due card arrotondate che recitano «TwIL-LM3-Pro - Non commerciale» e «Gemma 4 12B - Apache 2.0». Una riga a piè di pagina recita «La licenza decide più distribuzioni di qualsiasi riga di benchmark». Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

TwIL-LM3-Pro vs Gemma 4 12B: Due modelli locali che non hanno nulla in comune tranne il laptop

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti TwIL-LM3-Pro e Gemma 4 12B fianco a fianco e le somiglianze sono reali ma superficiali: entrambi sono checkpoint aperti che puoi scaricare oggi, entrambi girano su hardware consumer senza un account cloud, ed entrambi risponderanno alle domande offline. Tutto il resto diverge, e la divergenza più netta è legale anziché tecnica. TwIL-LM3-Pro, lo specialista di logica formale da 3,66B di webAI, è distribuito con la licenza webAI Non-Commercial License ver. 1.0 — puoi fare ricerca con esso e non puoi costruirci un business sopra senza un accordo separato. Gemma 4 12B, il modello multimodale senza encoder di Google DeepMind, è distribuito con Apache 2.0. Quella singola riga determina più implementazioni di quante ne determinerà la tabella dei benchmark, quindi vale la pena iniziare da lì anziché finire lì.

Questo è un confronto tra uno specialista e un generalista che poi sono lo stesso tipo di oggetto. TwIL-LM3-Pro fa un solo lavoro — la logica formale — e lo fa meglio di modelli molte volte più grandi. Gemma 4 12B fa molti lavori, vede e sente oltre che leggere, ed è progettato deliberatamente per essere il modello piccolo predefinito nel prodotto di qualcun altro. Leggere le loro schede tecniche l'una contro l'altra come se competessero per lo stesso posto è l'errore che questa pagina esiste per prevenire.

La licenza è la prima specifica

La licenza di TwIL-LM3-Pro consente la riproduzione, la ricerca e l'uso personale, e richiede esplicitamente un accordo separato con webAI per l'implementazione che genera ricavi. Impone inoltre restrizioni sull'uso dei nomi commerciali e dei marchi di webAI senza consenso scritto. Per un hobbista, uno studente di dottorato o un gruppo di ricerca interno, si tratta di un permesso completo. Per chiunque commercializzi un prodotto, è un blocco netto finché non esiste un accordo — e la via commerciale di webAI è un accordo enterprise, non un listino prezzi pubblicato.

Gemma 4 12B è Apache 2.0. Puoi fare fine-tuning, ridistribuire i derivati, erogarlo ai clienti e distribuirlo all'interno di un prodotto commerciale, nel rispetto della politica di utilizzo di Google. Non è una piccola differenza di grado; è la differenza tra un modello che puoi valutare e un modello su cui puoi costruire.

Entrambi sono download ad accesso libero su Hugging Face, quindi la licenza è l'unica barriera, ed è una barriera concreta.

A cosa serve realmente ogni modello

TwIL-LM3-Pro discende da `ibm-granite/granite-4.2-3b` attraverso una pipeline in cinque fasi — fine-tuning supervisionato LoRA su un corpus sintetico di logica formale, distillazione multipath, fusione di checkpoint, un'interpolazione WiSE-FT verso la base pre-addestrata e una fase GRPO ponderata per entropia contro un verificatore programmatico. I suoi output target sono oggetti anziché prosa: traduzioni in logica del primo ordine, etichette di implicazione, analisi semantiche, istruzioni Lean e critiche di dimostrazioni Lean. webAI afferma chiaramente che il modello non è un assistente generale e non porta alcun tuning di sicurezza o preferenze oltre a quello posseduto da Granite 4.2.

Gemma 4 12B è la costruzione opposta. È il membro denso da 11,95 miliardi di parametri della famiglia Gemma 4 — 48 livelli, un vocabolario da 262K, una finestra di contesto da 256K token — ed è nativamente multimodale, gestendo testo, immagini e audio attraverso un'architettura senza encoder anziché aggiungere torri separate per visione e audio. Tutti i modelli Gemma 4 includono modalità di pensiero configurabili, supporto nativo per i prompt di sistema e chiamata di funzioni. È progettato per essere un cavallo di battaglia per il ragionamento generale e multimodale, in una dimensione che entra in una GPU consumer.

Chiedere a TwIL-LM3-Pro di descrivere una fotografia non è un test equo, e non è un test per cui il modello è stato creato. Chiedere a Gemma 4 12B di produrre un parsing semantico in uno schema fisso non è nemmeno il compito per cui è stato messo a punto. La sovrapposizione è reale ma limitata: entrambi sanno ragionare, ed entrambi possono funzionare offline.

Le dimensioni che effettivamente differiscono

• Parametri — TwIL-LM3-Pro 3,66B denso vs Gemma 4 12B 11,95B denso, un fattore di circa 3,3.

• Finestra di contesto — TwIL-LM3-Pro 131.072 token, ereditata invariata dalla sua base Granite; Gemma 4 12B 256.000 token.

• Modalità in ingresso — TwIL-LM3-Pro solo testo; Gemma 4 12B testo, immagine, video e audio.

• Licenza — webAI Non-Commercial License ver. 1.0 vs Apache 2.0.

• Modello base — `ibm-granite/granite-4.2-3b` rispetto al pretraining di Gemma 4 di Google stesso, pubblicato insieme a un rapporto tecnico.

• Formato di pensiero — TwIL-LM3-Pro emette per impostazione predefinita un blocco `<think>` prima di rispondere; Gemma 4 espone modalità di pensiero configurabili in tutta la famiglia.

• Occupazione quantizzata — TwIL-LM3-Pro Q4_K_M a 2,09 GiB, in esecuzione su CPU o con 4 GB di VRAM; Gemma 4 12B in bf16 è di circa 24 GiB, dimensionato per una GPU consumer anziché per la grafica integrata di un portatile.

Quell'ultima riga è quella che mina più nettamente l'impostazione «entrambi girano in locale», e vale la pena essere precisi in merito. La rivendicazione di esecuzione locale di TwIL-LM3-Pro è una rivendicazione da laptop. Quella di Gemma 4 12B è una rivendicazione da GPU da workstation, mentre i modelli più piccoli di Google, E2B ed E4B, coprono la fascia davvero da telefono e laptop. Due modelli entrambi definiti locali non hanno la stessa soglia hardware.

A che punto sono le evidenze del benchmark

Ogni valore di prestazione per TwIL-LM3-Pro proviene dalla scheda del modello di webAI stessa, misurato sugli harness Track A e Track B della stessa azienda. Non esiste ancora alcuna valutazione indipendente. Il confronto che la scheda stessa evidenzia è con Qwen3-8B, non con alcun modello Gemma — il macro gate di webAI di 0,5539 contro lo 0,5336 di Qwen3-8B, con un vantaggio che la scheda descrive come all'interno del rumore di campionamento, e strict-7 di 0,2879 contro 0,2093, dove il divario non dipende dal credito di corrispondenza approssimativa. Rispetto alla sua stessa base Granite 4.2 3B, il macro gate in-domain sale da 0,4313 a 0,5539, mentre il macro held-out sui 10 dataset resta stabile a 0,7901 rispetto a 0,7942.

Gemma 4 12B ha un report tecnico pubblicato e un'ampia mole di valutazioni di terze parti. Ha anche una posizione di benchmark dichiarata dal fornitore all'interno della propria famiglia — Google classifica la build 12B Unified al di sotto della 31B e della 26B A4B nelle proprie tabelle di ragionamento e programmazione. Quel ranking è di Google, e vale la pena citarlo come tale.

L'affermazione onesta su un confronto diretto è che non esiste. Nessuno ha sottoposto TwIL-LM3-Pro e Gemma 4 12B a un banco di prova condiviso e pubblicato il risultato. I due non sono mai stati valutati sulla stessa griglia di valutazione da nessuno, perché le griglie di valutazione su cui vengono valutati non si sovrappongono. Un'accuratezza nell'implicazione logica formale e una percentuale MMLU-Pro non sono la stessa unità di misura.

Quando ciascuno è la scelta giusta

Ricorri a TwIL-LM3-Pro quando l'output di cui hai bisogno è una struttura verificabile automaticamente — un'etichetta di entailment, un enunciato Lean, una parse semantica — e il carico di lavoro è batch o offline, e la licenza non è un vincolo su ciò che fai con il risultato. La sua build quantizzata da 2,09 GiB che gira su CPU senza dipendenze di rete è un vero vantaggio per una pipeline air-gapped o una passata di etichettatura che deve girare su un laptop.

Affidati a Gemma 4 12B quando ti serve un modello generico che puoi distribuire, quando l'input non è testo, quando il contesto è lungo o quando devi fare fine-tuning e ridistribuire. Apache 2.0 più la multimodalità nativa più una finestra da 256K è una combinazione che nessuno degli specialisti di nicchia offre.

I due possono anche coesistere. Una pipeline che usa Gemma 4 12B per leggere e normalizzare un input a modalità mista e poi passa un'asserzione strutturata a uno specialista di logica formale è una ragionevole divisione del lavoro, ed è la stessa struttura dell'usare un modello di frontiera per redigere e un modello piccolo per verificare.

Servire l'uno o l'altro da un unico endpoint

Né TwIL-LM3-Pro né la build Unified di Gemma 4 12B sono attualmente una route nel catalogo OrcaRouter, e vale la pena affermarlo prima della raccomandazione, non dopo. Ciò che viene instradato dalla stessa famiglia sono i tier maggiori di Gemma 4 — `gemma-4-26b-a4b-it` e `gemma-4-31b-it` — quindi il pattern comune qui è prototipare il prompt e lo schema su un tier Gemma 4 ospitato tramite un endpoint compatibile con OpenAI al prezzo di listino del provider con 0% di markup aggiunto, per poi spostare il workload consolidato sul checkpoint 12B sul tuo hardware. Lo stesso endpoint serve oltre 200 modelli, quindi il modello frontier che usi per generare i dati di valutazione e il modello piccolo che usi per verificarli distano una chiave e un formato di richiesta, con failover automatico se un provider vacilla a metà esecuzione.

Questa è una versione più debole del racconto sul routing rispetto al solito, e va presentata come tale: non ospitiamo il modello che stai confrontando, quindi il consiglio onesto è un flusso di lavoro anziché un interruttore.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Gemma 4 12B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Context 131,072 tokens; Input text only; Licence non-commercial; Base granite-4.2-3b; Quantised size 2.09 GiB Q4_K_M. Gemma 4 12B: Parameters 11.95B dense; Context 256,000 tokens; Input text, image, audio; Licence Apache 2.0; Base Google Gemma 4 pretraining; Quantised size about 24 GiB in bf16. A footer line reads 'Gemma figures per Google model card; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

La regola di decisione

Se il deliverable deve essere commercialmente distribuibile, la licenza risponde alla domanda prima di qualsiasi benchmark, e indica Gemma 4 12B. Se il deliverable è un output di logica formale prodotto offline e utilizzato internamente, TwIL-LM3-Pro è lo strumento più potente, con un terzo delle dimensioni. Se ti servono entrambi, l'ingegneria interessante non è scegliere un vincitore — è definire l'interfaccia in cui un modello multimodale generale si ferma e inizia uno specialista di logica formale.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, dated 2026-04-02, showing the 30.7B dense multimodal description, a 256K token context window, the $0.13 input and $0.38 output rate, and the OrcaRouter chrome with Code samples, Pricing, Performance, Public benchmarks and FAQ sections.A screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing the Google author line, the Any-to-Any, Transformers, Safetensors and gemma4_unified tags, the Apache 2.0 licence badge, and the opening text describing the Gemma 4 12B Unified model as part of the Gemma 4 family with native audio and vision understanding and no separate encoders.