
TwIL-LM3-Pro vs Qwen 3.8 : un décalage, et la comparaison qui compte vraiment
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
TwIL-LM3-Pro et Qwen3.8-Max n'ont pas leur place sur la même page, et la raison n'est pas que l'un soit. C'est que l'argumentaire publié à propos du modèle de logique formelle de 3,66 B de webAI repose sur une comparaison avec un modèle Qwen — et le modèle Qwen en question n'est pas celui que nomme l'intitulé. Les tableaux Track A et Track B de webAI mesurent TwIL-LM3-Pro face à Qwen3-8B, un modèle dense à poids ouverts de 8 B d'une génération antérieure, et n'accordent aucune attention à Qwen3.8-Max : non pas parce que TwIL-LM3-Pro l'emporterait, mais parce que Qwen3.8-Max est le système hébergé phare d'Alibaba, un modèle à mélange d'experts clairsemé annoncé à 2,4 billions de paramètres, dont environ 95 milliards actifs par token, avec une fenêtre de contexte multimodale d'un million de tokens et une grille tarifaire de 2,00 $ par million de tokens en entrée et de 6,00 $ par million en sortie. Placer à côté de cela un GGUF de 2,09 GiB pour ordinateur portable, c'est une erreur de catégorie déguisée en page de comparatif.
Ce texte fait deux choses. Il corrige la comparaison que les résultats de recherche présentent de façon erronée, puis il répond à la version de la question que le lecteur se pose probablement en réalité : étant donné qu’un modèle de pointe est accessible en un seul appel API et qu’un spécialiste de la logique formelle s’exécute sur votre propre machine, quand chacun d’eux mérite-t-il sa place ?
Le modèle que la carte a réellement mesuré
La comparaison pertinente se fait avec Qwen3-8B, et le résumé qu'en donne webAI lui-même est plus modeste que ne le suggèrent les articles de seconde main. Le gate macro en domaine de TwIL-LM3-Pro est de 0,5539 contre 0,5336 pour Qwen3-8B, et la fiche du modèle contient la phrase qu'une page marketing aurait supprimée : l'avance sur le gate est de 0,020, « inférieure au bruit d'échantillonnage à n = 200 par voie — donc à interpréter comme une parité, pas comme une victoire. »
Là où la comparaison n’a rien d’un pile ou face : strict-7, 0,2879 contre 0,2093, une ligne qui n’utilise nulle part de crédit de correspondance approximative et ne peut donc pas être fabriquée par le formatage. Choix multiple strict, 0,4100 contre 0,0000. Induction de règles, 0,4195 contre 0,3680. Et le rapport de paramètres — 3,66B contre environ 8B — qui constitue à lui seul toute l’affirmation « moins de la moitié de la taille ».
Sur la suite de test retenue, webAI est encore plus direct : « TwIL-LM3-Pro n’y est pas en tête. » La macro sur dix jeux de données est de 0,7901, au niveau de sa propre base Granite et derrière les 0,8493 de Qwen3-8B. Un petit spécialiste qui égale un modèle généraliste deux fois plus grand que lui en logique formelle et qui lui cède sur les capacités générales correspond au profil attendu, et c’est en le présentant ainsi que le chiffre strict-7 devient crédible.
Ce qu'est réellement Qwen3.8-Max
Qwen3.8-Max n'est pas une itération de Qwen3-8B. Il s'agit du niveau premium d'Alibaba, et sur la page du catalogue OrcaRouter, il apparaît sous la référence `qwen/qwen3.8-max` avec une date de sortie au 3 août 2026, une fenêtre de contexte d'un million de tokens, une entrée texte, image et vidéo, une sortie texte, et une prise en charge complète du mode réflexion, de l'appel de fonctions, des outils intégrés et des sorties structurées. Il est servi via des tableaux de bord compatibles OpenAI, compatibles Anthropic et natifs dans cinq régions, et la réflexion s'active avec le paramètre `enable_thinking`. Le tarif est de 2,00 $ par million de tokens d'entrée et de 6,00 $ par million de tokens de sortie.
Un instantané daté, `qwen/qwen3.8-max-0902`, a été publié le 2 septembre 2026 avec les mêmes capacités et la même tarification, publié spécifiquement afin que le comportement puisse être figé pour des exécutions reproductibles. Si vous développez avec Qwen3.8-Max pour quoi que ce soit de longue durée, c’est cet identifiant d’instantané qu’il faut mettre dans la configuration plutôt que l’alias évolutif.
Notez ce qui est absent de cette description : un nombre de paramètres que vous pouvez télécharger, un fichier de licence, et le moindre moyen de l'exécuter vous-même. Qwen3.8-Max est un produit hébergé. La couverture journalistique au lancement faisait état de poids ouverts promis pour la semaine suivante, et la formulation de techsy — « 2,4 T de paramètres, 1 M de contexte, pas encore de poids » — correspond à un état que le lecteur devrait vérifier plutôt que présumer, car une promesse rapportée au lancement n'est pas un checkpoint publié.
Quatre dimensions, et aucune d’elles n’est proche
• Paramètres — TwIL-LM3-Pro 3,66 B dense, tous actifs, contre Qwen3.8-Max annoncé à 2,4 T au total dans une architecture à mélange d’experts clairsemé avec environ 95 B actifs par token. Trois ordres de grandeur sur le total, deux sur les actifs.
• Où il s'exécute — TwIL-LM3-Pro se télécharge en bf16 à 6,82 GiB ou en un GGUF Q4_K_M de 2,09 GiB pour CPU ou 4 Go de VRAM, contrairement à Qwen3.8-Max, qui n'existe que sous la forme d'un endpoint hébergé.
• Contexte — TwIL-LM3-Pro, 131 072 jetons, hérités de sa base Granite et jamais validés au-delà de 8 192 dans sa propre évaluation face à Qwen3.8-Max à 1 000 000 de jetons.
• Modalités — texte en entrée, texte en sortie vs texte, image et vidéo en entrée, texte en sortie.
• Licence — webAI Non-Commercial License ver. 1.0, avec un accord distinct requis pour une utilisation génératrice de revenus, contrairement à une API commerciale hébergée sans poids à concéder sous licence.
• Coût — TwIL-LM3-Pro : aucun frais par token et aucun point de terminaison hébergé, contre 2,00 $ par million de tokens en entrée et 6,00 $ par million de tokens en sortie pour Qwen3.8-Max, avec un tarif d'entrée mise en cache d'environ 0,25 $ par million.
Un modèle 3,66B est bon marché parce qu’il est petit, et il est petit parce qu’il fait une seule chose. Qwen3.8-Max est cher parce qu’il est généraliste et qu’il est hébergé. Aucun de ces tarifs n’est un verdict.
La question derrière la question
Si l’on écarte la confusion liée au nom, il reste une question d’ingénierie, et c’est une bonne question : si un modèle hébergé de pointe peut raisonner sur la logique formelle, pourquoi faire tourner un spécialiste étroit, tout court ?
Trois raisons tiennent la route. La première est la licence et le réseau : un groupe de recherche non commercial, un environnement isolé (air-gapped) ou une passe d’étiquetage par lots qui doit tourner sur un ordinateur portable sans connectivité ne peut pas appeler un point de terminaison hébergé, et un GGUF de 2,09 GiB répond directement à cette contrainte. La deuxième est la structure des coûts en fonction du volume — une tâche d’étiquetage en logique formelle portant sur un million d’entrées courtes est facturée au token sur un modèle de pointe hébergé et ne coûte que le temps d’exécution sur un modèle local. La troisième est la forme des sorties : TwIL-LM3-Pro a été ajusté pour émettre des structures vérifiables par machine plutôt que de la prose, et pour les étiquettes d’implication et les analyses sémantiques, c’est un pipeline plus court que de solliciter un modèle généraliste puis d’analyser sa réponse.
Face à cela, le cas de Qwen3.8-Max est simple. Il voit des images et de la vidéo, il gère un million de tokens, il prend en charge les outils et la sortie structurée via une API documentée, et il s’appuie sur des benchmarks publiés et une évaluation indépendante. Rien dans un spécialiste étroit ne menace cela ; les deux répondent à des ensembles de contraintes différents.
La stack qui utilise les deux
Le schéma qui survit au contact d’un vrai pipeline est à deux étages, et il n’a rien d’exotique. Un modèle hébergé de pointe lit l’entrée désordonnée — une page de manuel scannée, une source multimodale, une longue spécification — et la transforme en texte structuré propre. Ce texte va à un modèle local de logique formelle dont tout le travail est d’émettre une étiquette, une analyse syntaxique ou une critique Lean sur du matériel qui vous appartient. Le verdict sur la question de savoir si ce second étage vaut son coût de maintenance est la comparaison de style strict-7, et non le filtre, car un spécialiste gagne sa place sur les voies où la métrique ne laisse aucune place à une notation indulgente.
Il y a aussi un indice à retenir de la propre fiche de webAI : le pipeline a été exécuté sur cinq modèles de base différents, seul le coefficient de fusion changeant selon le modèle, et webAI rapporte le résultat pour chacun, y compris ceux qui ont le moins bougé. C’est une affirmation plus forte à propos d’une recette que n’importe quelle ligne de benchmark isolée, et c’est le genre de preuve qui indique qu’une méthode se généralise plutôt qu’un checkpoint n’a eu de la chance.
Qu'est-ce qui est routable ici, et qu'est-ce qui ne l'est pas ?
C'est le seul endroit où les deux modèles figurent honnêtement dans la même phrase. Qwen3.8-Max est une route : il est servi via OrcaRouter en tant que `qwen/qwen3.8-max`, et parce que la plateforme répercute le prix catalogue du fournisseur en ajoutant 0 % de marge, le tarif de 2,00 $/6,00 $ est celui du fournisseur et une baisse de prix de sa part est effective le jour même plutôt qu'après un cycle contractuel. L'instantané daté `qwen/qwen3.8-max-0902` est routable à ses côtés, de sorte que figer un identifiant de modèle reproductible relève d'un choix de configuration plutôt que d'une relation fournisseur distincte.
TwIL-LM3-Pro n’est pas une route, et il serait malhonnête de laisser entendre le contraire. Il est sous licence non commerciale sans point de terminaison hébergé publié, et la façon actuelle de l’utiliser consiste à télécharger le checkpoint et à l’exécuter vous-même. Ce que le routeur fait pour un pipeline construit autour de lui, c’est le travail textuel périphérique — l’expansion du prompt, la génération de corpus, la passe de filtrage — qui s’exécute sur le même point de terminaison compatible OpenAI face à plus de 200 modèles, de sorte que remplacer le modèle qui génère les données d’évaluation par le modèle qui les note ne coûte rien d’autre qu’une modification de configuration, avec basculement automatique pour maintenir un long lot en vie lorsqu’un fournisseur a un hoquet.
L'usage le plus défendable des deux ensemble est exactement celui-ci : un palier frontière routable qui assure le raisonnement général et l'extraction structurée, un spécialiste téléchargé qui assure le jugement en logique formelle, et une seule clé pour tout ce qui se trouve entre les deux.
Quel modèle comparer, et quand
Si vous évaluez de petits modèles de logique formelle, le Qwen qu’il vaut la peine de mettre à côté de TwIL-LM3-Pro est Qwen3-8B, et webAI a déjà publié cette comparaison avec les mises en garde qui l’accompagnent. Si vous choisissez où exécuter une charge de travail de production, Qwen3.8-Max est une décision entièrement différente — un système frontière hébergé avec une grille tarifaire et sans téléchargement — et la bonne question n’est pas de savoir lequel est meilleur, mais quelle contrainte s’impose : connectivité et licence d’un côté, contexte, modalité et échelle de l’autre. La plupart des systèmes réels finissent par avoir besoin des deux réponses.



Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
