Una tarjeta de título generada encabezada por 'TwIL-LM3-Pro vs Gemma 4 12B', con el subtítulo 'Dos modelos locales, dos licencias', con dos tarjetas redondeadas que dicen 'TwIL-LM3-Pro - No comercial' y 'Gemma 4 12B - Apache 2.0'. Una línea al pie dice 'La licencia decide más despliegues que cualquier fila de benchmark'. El logotipo de OrcaRouter está integrado en la esquina inferior derecha.
Guides & Insights

TwIL-LM3-Pro vs Gemma 4 12B: Dos modelos locales que no tienen nada en común salvo el portátil

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pon TwIL-LM3-Pro y Gemma 4 12B uno al lado del otro y las similitudes son reales pero superficiales: ambos son checkpoints abiertos que puedes descargar hoy, ambos funcionan en hardware de consumo sin una cuenta en la nube, y ambos responderán preguntas sin conexión. Todo lo que viene después diverge, y la divergencia más marcada es legal más que técnica. TwIL-LM3-Pro, el especialista en lógica formal de 3.66B de webAI, se distribuye bajo la webAI Non-Commercial License ver. 1.0 — puedes investigar con él y no puedes montar un negocio sobre él sin un acuerdo aparte. Gemma 4 12B, el modelo multimodal sin encoder de Google DeepMind, se distribuye bajo Apache 2.0. Esa única línea decide más despliegues de los que decidirá la tabla de benchmarks, así que vale la pena empezar por ahí en lugar de terminar ahí.

Esta es una comparación entre un especialista y un generalista que resultan ser el mismo tipo de objeto. TwIL-LM3-Pro hace un solo trabajo —lógica formal— y lo hace mejor que modelos varias veces su tamaño. Gemma 4 12B hace muchos trabajos, ve y oye además de leer, y está diseñado deliberadamente para ser el modelo pequeño predeterminado en el producto de otra persona. Leer sus fichas técnicas comparándolas entre sí como si compitieran por el mismo lugar es el error que esta página pretende evitar.

La licencia es la primera especificación.

La licencia de TwIL-LM3-Pro permite la reproducción, la investigación y el uso personal, y exige explícitamente un acuerdo por separado con webAI para el despliegue que genere ingresos. También restringe el uso de los nombres comerciales y las marcas de webAI sin consentimiento por escrito. Para un aficionado, un estudiante de doctorado o un grupo de investigación interno, eso es una autorización completa. Para cualquiera que lance un producto, es un límite infranqueable hasta que exista un acuerdo —y la vía comercial de webAI es un acuerdo empresarial, no una lista de precios publicada.

Gemma 4 12B es Apache 2.0. Puedes ajustarlo, redistribuir la obra derivada, servirlo a clientes e incluirlo en un producto comercial, sujeto a la política de uso de Google. Eso no es una pequeña diferencia de grado; es la diferencia entre un modelo que puedes evaluar y un modelo sobre el que puedes construir.

Ambas son descargas sin restricciones en Hugging Face, así que la licencia es la única barrera, y es una barrera real.

Para qué sirve realmente cada modelo

TwIL-LM3-Pro desciende de `ibm-granite/granite-4.2-3b` a través de una canalización de cinco etapas: ajuste fino supervisado con LoRA sobre un corpus sintético de lógica formal, destilación de rutas múltiples, fusión de checkpoints, una interpolación WiSE-FT de regreso hacia la base preentrenada y una etapa GRPO ponderada por entropía frente a un verificador programático. Sus salidas objetivo son objetos en lugar de prosa: traducciones a lógica de primer orden, etiquetas de implicación, análisis semánticos, enunciados Lean y críticas de pruebas Lean. webAI afirma claramente que el modelo no es un asistente general y que no incorpora ajuste de seguridad ni de preferencias más allá del que tenía Granite 4.2.

Gemma 4 12B es la construcción opuesta. Es el miembro denso de 11.95B parámetros de la familia Gemma 4 —48 capas, un vocabulario de 262K, una ventana de contexto de 256K tokens— y es multimodal de forma nativa, ya que procesa texto, imagen y audio mediante una arquitectura sin codificador en lugar de incorporar torres independientes de visión y audio. Todos los modelos Gemma 4 vienen con modos de razonamiento configurables, compatibilidad nativa con indicaciones de sistema y llamadas a funciones. Está diseñado para ser un caballo de batalla del razonamiento general y multimodal en un tamaño que cabe en una GPU de consumo.

Pedirle a TwIL-LM3-Pro que describa una fotografía no es una prueba justa, y no es una prueba que el modelo estuviera diseñado para realizar. Pedirle a Gemma 4 12B que emita un análisis semántico en un esquema fijo tampoco es la tarea para la que fue ajustado. La superposición es real pero limitada: ambos pueden razonar y ambos pueden ejecutarse sin conexión.

Las dimensiones que realmente difieren

• Parámetros — TwIL-LM3-Pro 3,66B denso vs Gemma 4 12B 11,95B denso, un factor de aproximadamente 3,3.

• Ventana de contexto — TwIL-LM3-Pro 131.072 tokens, heredada sin cambios de su base Granite; Gemma 4 12B 256.000 tokens.

• Modalidades de entrada — TwIL-LM3-Pro solo texto; Gemma 4 12B texto, imagen, video y audio.

• Licencia — webAI Non-Commercial License ver. 1.0 vs Apache 2.0.

• Modelo base — `ibm-granite/granite-4.2-3b` frente al propio preentrenamiento de Gemma 4 de Goog​le, publicado junto con un informe técnico.

• Formato de pensamiento — TwIL-LM3-Pro emite un bloque `<think>` por defecto antes de responder; Gemma 4 expone modos de pensamiento configurables en toda la familia.

• Huella cuantizada — TwIL-LM3-Pro Q4_K_M de 2.09 GiB, que se ejecuta en CPU o con 4 GB de VRAM; Gemma 4 12B en bf16 es de aproximadamente 24 GiB, pensado para una GPU de consumo en lugar de los gráficos integrados de un portátil.

Esa última línea es la que socava más tajantemente el planteamiento de «ambos se ejecutan localmente», y vale la pena ser precisos al respecto. La afirmación de localidad de TwIL-LM3-Pro es una afirmación para portátil. La afirmación de localidad de Gemma 4 12B es una afirmación de GPU de estación de trabajo, mientras que los modelos más pequeños de Google, E2B y E4B, cubren el segmento genuinamente de teléfonos y portátiles. Dos modelos a los que se llama locales no fijan el mismo listón de hardware.

En qué punto se encuentra la evidencia del benchmark

Todas las cifras de rendimiento de TwIL-LM3-Pro provienen de la propia tarjeta de modelo de webAI, medidas en los propios arneses Track A y Track B de la empresa. Todavía no existe ninguna evaluación independiente. La comparación que la propia tarjeta destaca es contra Qwen3-8B, no contra ningún modelo Gemma: el macro gate de webAI de 0,5539 frente al 0,5336 de Qwen3-8B, con una ventaja que la tarjeta describe como dentro del ruido de muestreo, y el strict-7 de 0,2879 frente a 0,2093, donde la brecha no depende del crédito por coincidencia flexible. Frente a su propia base Granite 4.2 3B, el macro gate en dominio sube de 0,4313 a 0,5539, mientras que el macro de 10 conjuntos de datos reservados se mantiene estable en 0,7901 frente a 0,7942.

Gemma 4 12B tiene un informe técnico publicado y un amplio conjunto de evaluaciones de terceros. También tiene una posición en benchmarks reportada por el proveedor dentro de su propia familia: Google sitúa la versión 12B Unified por debajo de la 31B y la 26B A4B en sus propias tablas de razonamiento y programación. Ese puesto es de Google, y vale la pena citarlo como tal.

La afirmación honesta sobre una comparación directa es que no existe ninguna. Nadie ha ejecutado TwIL-LM3-Pro y Gemma 4 12B en un arnés compartido y ha publicado el resultado. Nunca nadie ha puntuado a los dos con la misma rúbrica, porque las rúbricas con las que se los puntúa no se solapan. Una precisión de implicación de lógica formal y un porcentaje de MMLU-Pro no son la misma unidad.

Cuándo cada uno es la elección correcta

Recurre a TwIL-LM3-Pro cuando la salida que necesitas sea una estructura verificable por máquina —una etiqueta de implicación, una declaración en Lean, un análisis semántico—, y la carga de trabajo sea por lotes o sin conexión, y la licencia no sea una restricción para lo que hagas con el resultado. Su compilación cuantizada de 2,09 GiB que se ejecuta en CPU sin dependencia de red es una ventaja real para una canalización con aislamiento de red o una pasada de etiquetado que tenga que ejecutarse en un portátil.

Recurre a Gemma 4 12B cuando necesites un modelo general que puedas lanzar al mercado, cuando la entrada no sea texto, cuando el contexto sea largo o cuando necesites ajustarlo y redistribuirlo. Apache 2.0 más la multimodalidad nativa más una ventana de 256K es una combinación que ninguno de los especialistas de nicho ofrece.

Ambos también pueden coexistir. Un pipeline que utiliza Gemma 4 12B para leer y normalizar una entrada de modalidad mixta y luego entrega un enunciado estructurado a un especialista en lógica formal es una división del trabajo razonable, y tiene la misma forma que usar un modelo de frontera para redactar y un modelo pequeño para verificar.

Sirviendo cualquiera de los dos desde un único endpoint

Ni TwIL-LM3-Pro ni la build de Gemma 4 12B Unified son actualmente una ruta en el catálogo de OrcaRouter, y vale la pena decirlo antes de la recomendación en lugar de después. Lo que sí se enruta de la misma familia son los niveles más grandes de Gemma 4 —`gemma-4-26b-a4b-it` y `gemma-4-31b-it`—, así que el patrón común aquí es prototipar el prompt y el esquema contra un nivel alojado de Gemma 4 a través de un endpoint compatible con OpenAI al precio de lista del proveedor con 0% de margen añadido, y luego trasladar la carga de trabajo ya definida al checkpoint de 12B en tu propio hardware. El mismo endpoint sirve más de 200 modelos, así que el modelo frontera que usas para generar datos de evaluación y el modelo pequeño que usas para verificarlos están separados por una sola clave y un solo formato de solicitud, con conmutación automática por error si un proveedor falla a mitad de ejecución.

Esa es una versión más débil de lo habitual del argumento sobre el enrutamiento, y conviene presentarla como tal: no alojamos el modelo que estás comparando, así que el consejo honesto es un flujo de trabajo y no un cambio.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Gemma 4 12B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Context 131,072 tokens; Input text only; Licence non-commercial; Base granite-4.2-3b; Quantised size 2.09 GiB Q4_K_M. Gemma 4 12B: Parameters 11.95B dense; Context 256,000 tokens; Input text, image, audio; Licence Apache 2.0; Base Google Gemma 4 pretraining; Quantised size about 24 GiB in bf16. A footer line reads 'Gemma figures per Google model card; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

La regla de decisión

Si el entregable tiene que ser comercialmente desplegable, la licencia responde a la pregunta antes que cualquier prueba comparativa, y apunta a Gemma 4 12B. Si el entregable es una salida de lógica formal producida sin conexión y consumida internamente, TwIL-LM3-Pro es la herramienta más potente con un tercio del tamaño. Si necesitas ambas cosas, la ingeniería interesante no es elegir un ganador — es definir la interfaz donde termina un modelo multimodal general y empieza un especialista en lógica formal.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, dated 2026-04-02, showing the 30.7B dense multimodal description, a 256K token context window, the $0.13 input and $0.38 output rate, and the OrcaRouter chrome with Code samples, Pricing, Performance, Public benchmarks and FAQ sections.A screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing the Google author line, the Any-to-Any, Transformers, Safetensors and gemma4_unified tags, the Apache 2.0 licence badge, and the opening text describing the Gemma 4 12B Unified model as part of the Gemma 4 family with native audio and vision understanding and no separate encoders.