
TwIL-LM3-Pro vs Gemma 4 12B : deux modèles locaux qui n'ont en commun que l'ordinateur portable
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Placez TwIL-LM3-Pro et Gemma 4 12B côte à côte et les similitudes sont réelles mais superficielles : les deux sont des checkpoints ouverts que vous pouvez télécharger dès aujourd'hui, les deux tournent sur du matériel grand public sans compte cloud, et les deux répondront à vos questions hors ligne. Tout ce qui suit diverge, et la divergence la plus tranchée est juridique plutôt que technique. TwIL-LM3-Pro, le spécialiste de logique formelle de 3,66 B de webAI, est distribué sous la licence non commerciale webAI ver. 1.0 — vous pouvez l'utiliser pour la recherche et vous ne pouvez pas bâtir une entreprise dessus sans accord distinct. Gemma 4 12B, le modèle multimodal sans encodeur de Google DeepMind, est distribué sous Apache 2.0. Cette seule ligne décide de plus de déploiements que le tableau de benchmarks ne le fera, alors il vaut la peine de commencer par là plutôt que de terminer par là.
Voici une comparaison entre un spécialiste et un généraliste qui se trouvent être le même type d'objet. TwIL-LM3-Pro accomplit une seule tâche — la logique formelle — et le fait mieux que des modèles plusieurs fois plus gros. Gemma 4 12B accomplit de nombreuses tâches, voit et entend aussi, et est délibérément conçu pour être le petit modèle par défaut dans le produit de quelqu'un d'autre. Comparer leurs fiches techniques comme s'ils étaient en concurrence pour le même créneau est l'erreur que cette page vise à éviter.
La licence est la première spécification
La licence de TwIL-LM3-Pro autorise la reproduction, la recherche et l’usage personnel, et exige explicitement un accord distinct avec webAI pour tout déploiement générateur de revenus. Elle restreint également l’utilisation des noms commerciaux et des marques de webAI sans consentement écrit. Pour un amateur, un doctorant ou un groupe de recherche interne, il s’agit d’une autorisation complète. Pour quiconque commercialise un produit, c’est un arrêt net tant qu’un accord n’existe pas — et la voie commerciale de webAI est un arrangement d’entreprise, non une grille tarifaire publiée.
Gemma 4 12B est sous licence Apache 2.0. Vous pouvez le fine-tuner, redistribuer le dérivé, le mettre à la disposition de clients et l’intégrer dans un produit commercial, sous réserve de la politique d’utilisation de Google. Il ne s’agit pas d’une simple différence de degré ; c’est la différence entre un modèle que vous pouvez évaluer et un modèle sur lequel vous pouvez bâtir.
Les deux sont des téléchargements sans restriction sur Hugging Face, donc la licence est le seul verrou, et c'en est un vrai.
À quoi sert réellement chaque modèle
TwIL-LM3-Pro est issu de `ibm-granite/granite-4.2-3b` via un pipeline en cinq étapes — un affinage supervisé LoRA sur un corpus synthétique de logique formelle, une distillation multi-chemins, une fusion de points de contrôle, une interpolation WiSE-FT vers la base préentraînée, et une étape GRPO pondérée par l'entropie face à un vérificateur programmatique. Ses sorties cibles sont des objets plutôt que de la prose : traductions en logique du premier ordre, étiquettes d'implication, analyses sémantiques, énoncés Lean et critiques de preuves Lean. webAI déclare clairement que le modèle n'est pas un assistant généraliste et ne comporte aucun réglage de sécurité ou de préférence au-delà de ce que Granite 4.2 possédait.
Gemma 4 12B est la construction inverse. C'est le membre dense à 11,95 milliards de paramètres de la famille Gemma 4 — 48 couches, un vocabulaire de 262 K, une fenêtre de contexte de 256 K jetons — et il est nativement multimodal, gérant le texte, l'image et l'audio via une architecture sans encodeur plutôt qu'en ajoutant des modules distincts pour la vision et l'audio. Tous les modèles Gemma 4 sont livrés avec des modes de réflexion configurables, une prise en charge native des invites système et l'appel de fonctions. Il est conçu pour être un cheval de labour polyvalent du raisonnement et du multimodal, d'une taille qui tient sur un GPU grand public.
Demander à TwIL-LM3-Pro de décrire une photographie n’est pas un test équitable, et ce n’est pas un test pour lequel le modèle a été conçu. Demander à Gemma 4 12B de produire une analyse sémantique selon un schéma fixe n’est pas non plus la tâche pour laquelle il a été optimisé. Le chevauchement est réel mais étroit : les deux savent raisonner, et les deux peuvent fonctionner hors ligne.
Les dimensions qui diffèrent réellement
• Paramètres — TwIL-LM3-Pro 3,66 B dense vs Gemma 4 12B 11,95 B dense, soit un facteur d'environ 3,3.
• Fenêtre de contexte — TwIL-LM3-Pro 131 072 jetons, héritée inchangée de sa base Granite ; Gemma 4 12B 256 000 jetons.
• Modalités d’entrée — TwIL-LM3-Pro texte uniquement ; Gemma 4 12B texte, image, vidéo et audio.
• Licence — webAI Non-Commercial License ver. 1.0 vs Apache 2.0.
• Modèle de base — `ibm-granite/granite-4.2-3b` vs le pré-entraînement de Gemma 4 propre à Google, publié parallèlement à un rapport technique.
• Format de réflexion — TwIL-LM3-Pro émet un bloc `<think>` par défaut avant de répondre ; Gemma 4 expose des modes de réflexion configurables dans toute la famille.
• Empreinte quantifiée — TwIL-LM3-Pro Q4_K_M à 2,09 GiB, fonctionnant sur CPU ou 4 Go de VRAM ; Gemma 4 12B en bf16 fait environ 24 GiB, dimensionné pour un GPU grand public plutôt que pour les graphiques intégrés d’un ordinateur portable.
Cette dernière phrase est celle qui sape le plus nettement le cadrage « les deux tournent en local », et il vaut la peine d’être précis à ce sujet. L’argument de fonctionnement local de TwIL-LM3-Pro est un argument d’ordinateur portable. L’argument local de Gemma 4 12B est un argument de station de travail avec GPU, les plus petits modèles E2B et E4B de Google assurant le véritable échelon téléphone et ordinateur portable. Deux modèles tous deux qualifiés de locaux ne fixent pas la même barre matérielle.
Où en sont les preuves du benchmark
Chaque chiffre de performance pour TwIL-LM3-Pro provient de la propre fiche modèle de webAI, mesuré sur les propres bancs d’essai Track A et Track B de l’entreprise. Aucune évaluation indépendante n’existe encore. La comparaison que la fiche elle-même met en avant porte sur Qwen3-8B, et non sur un quelconque modèle Gemma — le seuil macro de webAI de 0,5539 contre 0,5336 pour Qwen3-8B, avec une avance que la fiche décrit comme à l’intérieur du bruit d’échantillonnage, et strict-7 de 0,2879 contre 0,2093, où l’écart ne dépend pas du crédit de correspondance approximative. Par rapport à sa propre base Granite 4.2 3B, le seuil macro en domaine passe de 0,4313 à 0,5539, tandis que la macro sur les 10 jeux de données mis de côté reste stable à 0,7901 contre 0,7942.
Gemma 4 12B dispose d'un rapport technique publié et d'un large corpus d'évaluations par des tiers. Il présente également une position de benchmark rapportée par le fournisseur au sein de sa propre famille — Google classe la version 12B Unified en dessous des 31B et 26B A4B dans ses propres tableaux de raisonnement et de codage. Ce classement est celui de Google, et il vaut la peine de le citer comme tel.
L'affirmation honnête à propos d'une confrontation directe, c'est qu'il n'y en a pas. Personne n'a fait passer TwIL-LM3-Pro et Gemma 4 12B dans un harnais commun et publié le résultat. Ces deux modèles n'ont jamais été notés sur la même grille par qui que ce soit, parce que les grilles sur lesquelles ils sont notés ne se recoupent pas. Un taux d'exactitude d'implication en logique formelle et un pourcentage MMLU-Pro ne sont pas la même unité.
Quand chacun est le bon choix
Choisissez TwIL-LM3-Pro lorsque la sortie dont vous avez besoin est une structure vérifiable par machine — une étiquette d’implication, un énoncé Lean, une analyse sémantique — et que la charge de travail est par lots ou hors ligne, et que la licence ne constitue pas une contrainte sur ce que vous faites du résultat. Sa version quantifiée de 2,09 Gio fonctionnant sur CPU sans dépendance réseau est un véritable atout pour un pipeline isolé ou une passe d’étiquetage qui doit tourner sur un ordinateur portable.
Faites appel à Gemma 4 12B lorsque vous avez besoin d'un modèle général que vous pouvez déployer, lorsque l'entrée n'est pas du texte, lorsque le contexte est long, ou lorsque vous devez l'affiner et le redistribuer. Apache 2.0, la multimodalité native et une fenêtre de 256K : une combinaison qu'aucun des spécialistes étroits n'offre.
Les deux peuvent aussi coexister. Un pipeline qui utilise Gemma 4 12B pour lire et normaliser une entrée à modalités mixtes, puis transmet un énoncé structuré à un spécialiste de logique formelle, constitue une répartition raisonnable du travail, et il présente la même forme que l’utilisation d’un modèle de pointe pour rédiger et d’un petit modèle pour vérifier.
Servir l’un ou l’autre à partir d’un seul point de terminaison
Ni TwIL-LM3-Pro ni Gemma 4 12B Unified build ne figurent actuellement comme route dans le catalogue OrcaRouter, et cela vaut la peine de le préciser avant la recommandation plutôt qu'après. Ce qui est routé depuis la même famille, ce sont les paliers Gemma 4 supérieurs — `gemma-4-26b-a4b-it` et `gemma-4-31b-it` — donc le modèle courant ici consiste à prototyper le prompt et le schéma contre un palier Gemma 4 hébergé sur un endpoint compatible OpenAI au prix catalogue du fournisseur, avec 0 % de marge ajoutée, puis à déplacer la charge de travail stabilisée vers le checkpoint 12B sur votre propre matériel. Le même endpoint sert plus de 200 modèles, donc le modèle de pointe que vous utilisez pour générer les données d'évaluation et le petit modèle que vous utilisez pour les vérifier ne sont séparés que par une clé et un format de requête, avec basculement automatique si un fournisseur vacille en cours d'exécution.
C’est une version plus faible que d’habitude du récit de routage, et il faut la présenter comme telle : nous n’hébergeons pas le modèle que vous comparez, donc le conseil honnête est un flux de travail plutôt qu’un simple basculement.

La règle de décision
Si le livrable doit être commercialement déployable, la licence répond à la question avant tout benchmark, et elle pointe vers Gemma 4 12B. Si le livrable est une sortie de logique formelle produite hors ligne et consommée en interne, TwIL-LM3-Pro est l’outil le plus puissant, pour un tiers de la taille. Si vous avez besoin des deux, l’ingénierie intéressante ne consiste pas à choisir un gagnant — elle consiste à définir l’interface où un modèle multimodal général s’arrête et où un spécialiste de la logique formelle commence.


