
TwIL-LM3-Pro : un modèle de logique formelle de 3,66 milliards qui est livré sur demande par e-mail
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
TwIL-LM3-Pro est un modèle de raisonnement à 3,66 milliards de paramètres de webAI, conçu spécifiquement pour la logique formelle plutôt que pour la conversation générale, et il est présent sur Hugging Face depuis le 3 septembre 2026. Ce n’est pas une nouvelle sortie, et le cadrage qui circule autour de lui cette semaine — selon lequel webAI « a publié un modèle de 3,66 B » — a un mois de retard sur les poids. Ce qui a réellement changé ces derniers jours est plus petit et plus utile : le checkpoint a été révisé le 30 septembre, et le 1er octobre, webAI a publié une version LiteRT-LM du modèle pour l’inférence sur appareil Android et iOS. Donc la question intéressante n’est pas ce qu’est TwIL-LM3-Pro, mais si vous pouvez l’obtenir, et la réponse dépend du canal de distribution, parmi trois, dans lequel vous vous trouvez — car l’un d’eux est un formulaire.
Cette distinction compte plus qu’elle ne le ferait normalement, car TwIL-LM3-Pro n’est pas un produit que l’on peut simplement appeler. C’est un checkpoint que vous téléchargez, exécutez sur votre propre matériel et dont vous acceptez les termes d’une licence qui interdit tout usage commercial. La comparaison que sa propre fiche de modèle invite à faire — avec Qwen3-8B, un modèle qui compte plus du double des paramètres — est réelle, mais c’est une comparaison de benchmarks exécutés par le fournisseur sur un banc d’essai conçu par le fournisseur, et la fiche de modèle le dit elle-même dans plus d’endroits que la plupart. Cet article lit cette fiche de près et sépare ce que webAI a mesuré de ce dont quiconque d’autre dispose.
Ce qu'est réellement le modèle
` avant de répondre et a été évalué avec un décodage glouton sur un budget de 2 048 tokens." Need check "dense Granite decoder" = décodeur Granite dense. "hidden size" taille cachée. "attention heads against key-value heads" maybe "40 têtes d’attention contre 8 têtes clé-valeur" or "pour". "parameter count" nombre de paramètres. "real total" total réel. Context window "fenêtre de contexte". "carried through unchanged" "conservée telle quelle". "greedy decoding" "décodage glouton". "2,048-token budget" "budget de 2 048 tokens". Need preserve backticks and `<think>…</think>`. Should ellipsis char? It's `…` inside tag. Keep exactly. No markers. Output only translation. Ensure numbers formatting: in French use non-breaking? We can use spaces. "2 560", "3,66 B" maybe "3,66 milliards"? Original "3.66B parameter count" maybe "3,66 B". Keep "3,66 B". "3,659,737,600" in French maybe "3 659 737 600". But preserving exact number maybe with commas? User says preserve URLs and brand/product names, not necessarily numeric format. Translation should localize. But "3,659,737,600" is exact. French convention spaces. I'd use "3 659 737 600" maybe acceptable. But to avoid altering exact total? Numeric separator change is localization, not content. However "exact total" maybe keep commas? Hmm. Professional localization would use French number formatting: 3 659 737 600. But the original uses English comma. "2,048-token" -> "2 048". "131,072" -> "131 072". "2,560" -> "2 560". Use narrow no-break spaces perhaps. We'll use normal spaces. Need maybe "taille masquée" not cached. "hidden size" in ML French often "taille de la couche cachée" or "dimension cachée". "hidden size 2,560" = "taille cachée de 2 560". Fine. "40 attention heads against 8 key-value heads" -> "40 têtes d’attention contre 8 têtes clé-valeur". Good. "derived from IBM's `granite-4.2-3b`" -> "dérivé de `granite-4.2-3b` d’IBM". Product name preserved. "It emits a `<think>…</think>` block before answering" -> "Il émet un bloc `<think>…</think>` avant de répondre". Keep tag exact, ellipsis char. "was evaluated with greedy decoding at a 2,048-token budget" -> "a été évalué avec un décodage glouton sur un budget de 2 048 tokens". Could "à un budget de 2 048 tokens". Fine. Should "TwIL-LM3-Pro" unchanged. "Granite" unchanged. "IBM" unchanged. "GraniteForCausalLM" in code unchanged. `granite-4.2-3b` unchanged. `think` tag unchanged. No markers. Output only translated text.TwIL-LM3-Pro est un décodeur Granite dense — `GraniteForCausalLM`, 40 couches, taille cachée de 2 560, 40 têtes d’attention contre 8 têtes clé-valeur — dérivé de `granite-4.2-3b` d’IBM. Le nombre de paramètres de 3,66 B correspond au total réel, 3 659 737 600, et la fenêtre de contexte est celle du modèle de base, 131 072 tokens, conservée telle quelle. Il émet un bloc `<think>…</think>` avant de répondre et a été évalué avec un décodage glouton sur un budget de 2 048 tokens.
La pile de post-entraînement est la partie que webAI veut réellement que vous regardiez, et elle est inhabituellement bien documentée pour un modèle de cette taille : un affinage supervisé LoRA de rang 64 sur un corpus synthétique de logique formelle, une distillation multiparcours pour produire plusieurs traces de raisonnement par prompt, une fusion de checkpoints dans l’espace des paramètres plutôt que de prendre le checkpoint final, une interpolation WiSE-FT à α = 0,15 fusionnée vers la base pré-entraînée avec TIES et DARE-SLERP, et enfin une étape GRPO pondérée par l’entropie — webAI l’appelle MGPO — face à un vérificateur programmatique, exécutée jusqu’à l’étape 2580, qui est le checkpoint livré.
L’artefact publié est la politique fusionnée plutôt qu’un adaptateur LoRA, ce qui est le détail pratique : vous pouvez l’exécuter comme modèle autonome, en bf16 à 6,82 GiB, ou comme GGUF Q4_K_M à 2,09 GiB sur un CPU ou 4 Go de VRAM. C’est l’affirmation « tourne sur un ordinateur portable », et c’est la seule affirmation de toute la fiche qui soit trivialement vérifiable et donc digne de confiance.
La comparaison Qwen3-8B, à lire attentivement
Le titre que webAI met sur le modèle est que TwIL-LM3-Pro atteint le sommet de ses propres lignes de synthèse de la Track A à 3,66 B de paramètres. Les quatre lignes de synthèse sont une macro gate de 0,5539, strict-7 de 0,2879, une moyenne sur six voies de 0,5389, et macro_primary de 0,5875. Face à Qwen3-8B, la macro gate est de 0,5539 contre 0,5336 — et la fiche du modèle écrit elle-même la phrase qu’une page marketing aurait supprimée : « l’avance de la gate sur Qwen3-8B est de 0,020 — inférieure au bruit d’échantillonnage à n = 200 par voie — donc à interpréter comme une parité, pas comme une victoire. »
C’est la ligne la plus importante de la page. La propre manière dont webAI présente le résultat principal est qu’il s’agit d’une égalité. Là où la comparaison n’est pas une égalité :
• Strict-7 — TwIL-LM3-Pro 0.2879 vs Qwen3-8B 0.2093, et cette ligne n’utilise nulle part de crédit pour correspondance approximative, elle ne peut donc pas être obtenue par chance de formatage.
• QCM strict — TwIL-LM3-Pro 0.4100 vs Qwen3-8B 0.0000, l'écart de voie le plus large des onze lignes rapportées.
• Induction de règles — TwIL-LM3-Pro 0.4195 vs Qwen3-8B 0.3680.
• Ajustement au corpus — la perplexité `lm_corpus` la plus faible de tous les bras, à 2,3130, avec Qwen3-8B à 2,5478.
• Paramètres — 3,66 B contre environ 8 B, ce qui constitue tout le fondement de l’affirmation « moins de la moitié des paramètres ».
Deux réserves pèsent sur ce tableau, et webAI les énonce toutes les deux. Les générations de la piste A issues de TwIL-LM3-Pro font en moyenne 1 902 jetons, et 24,2 % d'entre elles atteignent le plafond de longueur, contre 564 jetons pour son propre prédécesseur TwIL-LM3 ; le terme employé dans la fiche pour l'écart qui en résulte est « indicatif plutôt qu'exact ». Et les chiffres de débit du tableau ont été mesurés lors d'une session ultérieure sur une version plus récente de vLLM (0.19.1) que les colonnes de comparaison (0.11.2), de sorte que les lignes de jetons par seconde sont comparables entre elles et seulement approximativement avec le reste.
Là où il ne gagne pas
Sur la suite de validation, la fiche du modèle est sans détour : « TwIL-LM3-Pro ne la domine pas. » La macro sur 10 jeux de données est de 0,7901, statistiquement au même niveau que son propre modèle de base à 0,7942, et bien derrière Qwen3-8B à 0,8493 et gpt-oss-120b à 0,8689. Sa macro sur 14 jeux de données, de 0,7425, dépasse son modèle de base de 0,0093, et tout ce gain provient de BBH-logic (0,9540 contre 0,9013 pour le modèle de base) — si l’on retire cette seule ligne, le modèle obtient une moyenne de 0,7263 sur les treize restants, en dessous des 0,7350 de VibeThinker-3B.
Il y a trois véritables points faibles au sein de la spécialisation, tous divulgués : la correspondance exacte de la traduction FOL à 0,0100, `procedural` à 0,1200 en strict, et la correspondance exacte de l'analyse sémantique à 0,0000. L'induction de règles n'analyse que 56,5 % de ses sorties. Et le modèle est verbeux par construction — environ 792 tokens par réponse Track B contre 482 pour son prédécesseur — ce qui est un coût, pas une capacité.
Rien de tout cela ne constitue une critique de la publication. C’est à quoi ressemble une fiche de modèle bien rédigée, et c’est pourquoi les chiffres ici peuvent être cités tout court.
Trois façons de l'obtenir, et l'une d'elles est un formulaire
La situation de distribution constitue la véritable nouvelle de la semaine et il vaut la peine de l'énoncer avec précision.
Les poids sont sur Hugging Face, en accès libre, sous la webAI Non-Commercial License ver. 1.0 — laquelle autorise la recherche et l’usage personnel, et exige un accord distinct avec webAI pour tout déploiement générant des revenus. Cette licence est la contrainte déterminante pour l’ensemble de la diffusion, et c’est pourquoi TwIL-LM3-Pro n’est pas un modèle que la plupart des équipes produit peuvent adopter tel quel.
webAI affirme que la famille a dépassé le demi-million de téléchargements en un mois, un chiffre que l’entreprise a publié dans sa propre annonce et qui n’a pas fait l’objet d’un audit indépendant. Les téléchargements d’un checkpoint gratuit et non commercial ne constituent pas un indicateur de l’utilisation en production, et webAI ne les présente pas comme tels.
La plateforme du fournisseur, quant à elle, n'est pas un point de terminaison public. webAI se présente comme une plateforme d'entreprise qui apporte l'IA à vos données, avec une application de modèle privilégiant le local, et son modèle commercial relève d'un accord d'entreprise plutôt que d'une grille tarifaire publiée par jeton. TwIL-LM3-Pro est également absent des grandes plateformes d'inférence tierces qui référencent les checkpoints ouverts — nous avons vérifié, et il ne figure pas non plus dans le catalogue OrcaRouter —, de sorte que la réponse concrète à la question « d'où puis-je l'appeler depuis une API » est que, pour l'instant, vous ne le pouvez généralement pas ; vous le téléchargez.
Le troisième canal est le nouveau. Le dépôt `TwIL-LM3-Pro-LiteRT-LM` est apparu le 1er octobre 2026, portant des artefacts `.litertlm` et étiqueté pour Android et iOS — l’empaquetage runtime LiteRT-LM propre à webAI des mêmes poids. Savoir si cette compilation hérite de la licence non commerciale est la question à trancher avant de bâtir des plans autour d’elle, car le dépôt parent, lui, l’hérite.
Pourquoi un spécialiste de logique formelle de cette envergure vaut la peine d’être suivi
La raison pour laquelle cette version ne cesse de refaire surface n'est pas le tableau des benchmarks. C'est que webAI a publié le pipeline, a exécuté la recette identique sur cinq modèles de base différents et a rapporté ce qui s'est passé. Le tableau de comparaison de la famille enregistre un mouvement du macro-gate de la piste A de +0,012 à +0,145 selon le modèle de base, l'ensemble de validation restant dans une marge de ±0,013 — la version avec traçabilité de « cela se généralise ». Le seul coefficient choisi par modèle est le poids de fusion, balayé sur la performance de l'ensemble de validation : 0,15 pour SmolLM3, 0 pour Granite et la base TwIL, 0,50 pour VibeThinker-3.
C’est une recette réutilisable pour transformer un petit modèle généraliste en spécialiste étroit sans détruire ce qu’il savait déjà, publiée avec les résultats négatifs joints. Pour quiconque a besoin d’étiquettes d’implication, de formalisation d’énoncés Lean ou d’analyses sémantiques plutôt que de prose fluide, un GGUF de 2,09 Gio qui fonctionne hors ligne, sans frais par appel et sans dépendance réseau, est une proposition différente de celle de tout modèle hébergé, quoi qu’en dise le tableau Elo.
La question ouverte est de savoir si les poids apparaîtront un jour sous une licence qui autorise un usage commercial, et si le portage LiteRT-LM est livré avec la même restriction. D'ici là, TwIL-LM3-Pro est un artefact de recherche avec une fiche de modèle d'une honnêteté inhabituelle — ce qui n'est pas rien.

Si vous avez besoin de cette fonctionnalité en production dès aujourd'hui
Pour un déploiement commercial, ce n'est pas le benchmark mais la licence qui fait obstacle, et le substitut pratique est un modèle hébergé vers lequel vous pouvez router le trafic. C'est la couche sur laquelle opère OrcaRouter : un point de terminaison unique compatible OpenAI devant plus de 200 modèles, au prix catalogue des fournisseurs, sans marge ajoutée, de sorte qu'une baisse de prix d'un fournisseur est effective le jour même, et non après un cycle contractuel. Pour la poignée de cas où un petit checkpoint de logique formelle convient vraiment — étiquetage par lots hors ligne, passe d'implication en environnement isolé, étape de prétraitement dont la sortie est une étiquette plutôt que de la prose —, la répartition honnête consiste à exécuter le modèle local là où la charge de travail va du texte vers l'étiquette, et à router le raisonnement connexe, l'expansion des invites et l'assurance qualité vers des modèles hébergés avec la même clé.
Une mise en garde qu'il vaut la peine de répéter dans cette section en particulier : avec le basculement automatique, vous pouvez aussi pointer vers un modèle avant de lui faire confiance sur un chemin de production, et revenir en arrière en modifiant une règle de routage plutôt qu'en redéployant. C'est le schéma qui convient à un modèle comme celui-ci lorsque son statut commercial n'est pas résolu.

Que regarder
Trois choses changeraient cette histoire. Un changement de licence, ou un portage LiteRT-LM clairement sous licence, ferait passer TwIL-LM3-Pro d’un artefact de recherche à un composant déployable. Son apparition sur une grande plateforme d’inférence hébergée lui donnerait une véritable API. Et une évaluation indépendante — menée par quelqu’un d’autre que webAI avec le harnais Track A — nous dirait si l’avance en strict-7 sur Qwen3-8B survit à une mesure faite par quelqu’un qui n’a pas construit le harnais. Aucune des trois ne s’est encore produite, et la fiche modèle est assez honnête pour qu’on voie exactement ce qui devrait être vrai pour qu’elles aient de l’importance.

