
TwIL-LM3-Pro vs Gemma 4 12B: Dois modelos locais sem nada em comum além do laptop
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Coloque TwIL-LM3-Pro e Gemma 4 12B lado a lado e as semelhanças são reais, mas superficiais: ambos são checkpoints abertos que você pode baixar hoje, ambos rodam em hardware de consumidor sem uma conta na nuvem, e ambos responderão a perguntas offline. Tudo além disso diverge, e a divergência mais acentuada é jurídica, não técnica. TwIL-LM3-Pro, o especialista em lógica formal de 3,66B da webAI, é distribuído sob a webAI Non-Commercial License ver. 1.0 — você pode fazer pesquisa com ele e não pode construir um negócio sobre ele sem um acordo separado. Gemma 4 12B, o modelo multimodal sem encoder do Google DeepMind, é distribuído sob a licença Apache 2.0. Essa única linha decide mais implantações do que a tabela de benchmarks decidirá, então vale a pena começar por aí em vez de terminar por aí.
Esta é uma comparação entre um especialista e um generalista que, por acaso, são o mesmo tipo de objeto. O TwIL-LM3-Pro faz um único trabalho — lógica formal — e fá-lo melhor do que modelos várias vezes maiores do que ele. O Gemma 4 12B faz muitos trabalhos, vê e ouve tão bem como lê, e foi deliberadamente concebido para ser o modelo pequeno predefinido no produto de outra pessoa. Ler as suas fichas técnicas uma contra a outra como se estivessem a competir pelo mesmo lugar é o erro que esta página existe para evitar.
A licença é a primeira especificação.
A licença do TwIL-LM3-Pro permite reprodução, pesquisa e uso pessoal, e exige explicitamente um acordo separado com a webAI para implantação que gere receita. Ela também restringe o uso de nomes comerciais e marcas da webAI sem consentimento por escrito. Para um entusiasta, um estudante de doutorado ou um grupo de pesquisa interno, isso é uma permissão completa. Para quem está lançando um produto, é uma barreira intransponível até que exista um acordo — e a via comercial da webAI é um arranjo empresarial, não uma tabela de preços publicada.
Gemma 4 12B é Apache 2.0. Você pode fazer fine-tuning nele, redistribuir a versão derivada, fornecê-lo a clientes e incorporá-lo a um produto comercial, sujeito à política de uso do Google. Isso não é uma pequena diferença de grau; é a diferença entre um modelo que você pode avaliar e um modelo sobre o qual você pode construir.
Ambos são downloads sem restrições no Hugging Face, então a licença é a única barreira, e é uma barreira de verdade.
Para que cada modelo realmente serve
O TwIL-LM3-Pro descende de `ibm-granite/granite-4.2-3b` por meio de um pipeline de cinco estágios — ajuste fino supervisionado com LoRA em um corpus sintético de lógica formal, destilação multipath, fusão de checkpoints, uma interpolação WiSE-FT de volta em direção à base pré-treinada e um estágio GRPO ponderado por entropia contra um verificador programático. Seus resultados-alvo são objetos, e não prosa: traduções para lógica de primeira ordem, rótulos de acarretamento, análises semânticas, declarações Lean e críticas de provas Lean. A webAI afirma claramente que o modelo não é um assistente geral e não carrega ajuste de segurança ou de preferência além do que o Granite 4.2 possuía.
O Gemma 4 12B é a construção oposta. É o modelo denso de 11,95 bilhões de parâmetros da família Gemma 4 — 48 camadas, um vocabulário de 262K, uma janela de contexto de 256K tokens — e é nativamente multimodal, lidando com texto, imagem e áudio por meio de uma arquitetura de codificador em vez de acoplar visão e áudio separados. Todos os modelos Gemma 4 vêm com modos de pensamento configuráveis, suporte nativo a prompt de sistema e chamada de funções. Ele foi projetado para ser um cavalo de batalha de raciocínio geral e multimodal em um tamanho que cabe em uma GPU de consumidor.
Pedir ao TwIL-LM3-Pro que descreva uma fotografia não é um teste justo, e não é um teste para o qual o modelo foi criado. Pedir ao Gemma 4 12B que emita uma análise semântica em um esquema fixo também não é a tarefa para a qual ele foi ajustado. A sobreposição é real, mas estreita: ambos conseguem raciocinar, e ambos conseguem rodar offline.
As dimensões que realmente diferem
• Parâmetros — TwIL-LM3-Pro 3,66B denso vs. Gemma 4 12B 11,95B denso, um fator de aproximadamente 3,3.
• Janela de contexto — TwIL-LM3-Pro 131.072 tokens, herdada inalterada de sua base Granite; Gemma 4 12B 256.000 tokens.
• Modalidades em — TwIL-LM3-Pro apenas texto; Gemma 4 12B texto, imagem, vídeo e áudio.
• Licença — Licença Não Comercial webAI ver. 1.0 vs Apache 2.0.
• Modelo base — `ibm-granite/granite-4.2-3b` vs o próprio pré-treinamento do Gemma 4 do Google, publicado em conjunto com um relatório técnico.
• Formato de pensamento — TwIL-LM3-Pro emite um bloco `<think>` por padrão antes de responder; Gemma 4 expõe modos de pensamento configuráveis em toda a família.
• Pegada quantizada — TwIL-LM3-Pro Q4_K_M com 2,09 GiB, rodando em CPU ou em 4 GB de VRAM; o Gemma 4 12B em bf16 tem cerca de 24 GiB, dimensionado para uma GPU de consumidor e não para os gráficos integrados de um laptop.
Essa última linha é a que mina mais bruscamente o enquadramento de que "ambos rodam localmente", e vale a pena ser preciso quanto a isso. A alegação de execução local do TwIL-LM3-Pro é uma alegação de laptop. A alegação de execução local do Gemma 4 12B é uma alegação de GPU de estação de trabalho, com os modelos menores E2B e E4B do Google atendendo ao nível genuinamente de celular e laptop. Dois modelos, ambos chamados de locais, não são o mesmo patamar de hardware.
Onde estão as evidências de benchmark
Todos os números de desempenho do TwIL-LM3-Pro vêm do próprio cartão de modelo da webAI, medidos nos harnesses Track A e Track B da própria empresa. Ainda não existe nenhuma avaliação independente. A comparação que o próprio cartão destaca é contra o Qwen3-8B, não contra qualquer modelo Gemma — o macro gate da webAI de 0,5539 contra 0,5336 do Qwen3-8B, com uma vantagem que o cartão descreve como dentro do ruído de amostragem, e strict-7 de 0,2879 contra 0,2093, em que a diferença não depende de crédito de loose-match. Contra a sua própria base Granite 4.2 3B, o macro gate in-domain sobe de 0,4313 para 0,5539, enquanto o macro de 10 datasets held-out permanece estável em 0,7901 contra 0,7942.
O Gemma 4 12B tem um relatório técnico publicado e um amplo conjunto de avaliações de terceiros. Ele também tem uma posição de benchmark relatada pelo fornecedor dentro de sua própria família — o Google classifica a versão 12B Unified abaixo do 31B e do 26B A4B em suas próprias tabelas de raciocínio e codificação. Essa classificação é do Google, e vale a pena citá-la como tal.
A declaração honesta sobre um confronto direto é que não existe um. Ninguém executou o TwIL-LM3-Pro e o Gemma 4 12B num mesmo harness compartilhado e publicou o resultado. Nunca ninguém os avaliou com a mesma rubrica, porque as rubricas com que são avaliados não se sobrepõem. Uma acurácia de implicação em lógica formal e um percentual no MMLU-Pro não são a mesma unidade.
Quando cada um é a escolha certa
Recorra ao TwIL-LM3-Pro quando o resultado de que precisa for uma estrutura verificável por máquina — uma etiqueta de implicação, um enunciado Lean, uma análise semântica — e a carga de trabalho for em lote ou offline, e a licença não for uma restrição ao que faz com o resultado. A sua compilação quantizada de 2,09 GiB a correr na CPU sem dependência de rede é uma vantagem genuína para um pipeline isolado da rede ou uma passagem de etiquetagem que tenha de correr num portátil.
Recorra ao Gemma 4 12B quando precisar de um modelo geral que possa lançar, quando a entrada não for texto, quando o contexto for longo, ou quando precisar de fazer ajuste fino e redistribuir. Apache 2.0 mais multimodalidade nativa mais uma janela de 256K é uma combinação que nenhum dos especialistas restritos oferece.
Os dois também podem coexistir. Um pipeline que usa o Gemma 4 12B para ler e normalizar uma entrada de modalidade mista e depois entrega uma declaração estruturada a um especialista em lógica formal é uma divisão razoável do trabalho, e tem a mesma forma que usar um modelo de fronteira para elaborar um rascunho e um modelo pequeno para verificar.
Servindo qualquer um deles a partir de um único endpoint
Nem o TwIL-LM3-Pro nem o Gemma 4 12B Unified build são atualmente uma rota no catálogo do OrcaRouter, e vale a pena afirmar isso antes da recomendação, e não depois dela. O que é roteado da mesma família são os níveis maiores do Gemma 4 — `gemma-4-26b-a4b-it` e `gemma-4-31b-it` — então o padrão comum aqui é prototipar o prompt e o esquema contra um nível hospedado do Gemma 4 por meio de um endpoint compatível com OpenAI ao preço de tabela do provedor, com 0% de markup adicionado, e depois mover a carga de trabalho consolidada para o checkpoint 12B no seu próprio hardware. O mesmo endpoint atende mais de 200 modelos, então o modelo de fronteira que você usa para gerar dados de avaliação e o modelo pequeno que você usa para verificá-los estão separados por apenas uma chave e um formato de requisição, com failover automático se um provedor oscilar no meio da execução.
Essa é uma versão mais fraca da narrativa de roteamento do que o habitual, e deve ser apresentada como tal: não hospedamos o modelo que você está comparando, então o conselho honesto é um fluxo de trabalho, e não uma mudança.

A regra de decisão
Se o entregável tiver de ser comercialmente implantável, a licença responde à pergunta antes que qualquer benchmark o faça, e aponta para o Gemma 4 12B. Se o entregável for uma saída de lógica formal produzida offline e consumida internamente, o TwIL-LM3-Pro é a ferramenta mais forte com um terço do tamanho. Se você precisar dos dois, a engenharia interessante não é escolher um vencedor — é definir a interface onde um modelo multimodal geral termina e um especialista em lógica formal começa.


