Une carte de titre générée intitulée « TwIL-LM3-Pro vs Qwen 3.8 », sous-titrée « La comparaison que la carte a réellement exécutée », avec deux cartes arrondies indiquant « TwIL-LM3-Pro - 3.66B, local, non commercial » et « Qwen3.8-Max - hébergé, contexte 1M, 2 $ / 6 $ ». Une ligne de pied de page indique « webAI mesuré par rapport à Qwen3-8B, et non à Qwen3.8-Max. » Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

TwIL-LM3-Pro vs Qwen 3.8 : un décalage, et la comparaison qui compte vraiment

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

TwIL-LM3-Pro et Qwen3.8-Max n'ont pas leur place sur la même page, et la raison n'est pas que l'un soit. C'est que l'argumentaire publié à propos du modèle de logique formelle de 3,66 B de webAI repose sur une comparaison avec un modèle Qwen — et le modèle Qwen en question n'est pas celui que nomme l'intitulé. Les tableaux Track A et Track B de webAI mesurent TwIL-LM3-Pro face à Qwen3-8B, un modèle dense à poids ouverts de 8 B d'une génération antérieure, et n'accordent aucune attention à Qwen3.8-Max : non pas parce que TwIL-LM3-Pro l'emporterait, mais parce que Qwen3.8-Max est le système hébergé phare d'Alibaba, un modèle à mélange d'experts clairsemé annoncé à 2,4 billions de paramètres, dont environ 95 milliards actifs par token, avec une fenêtre de contexte multimodale d'un million de tokens et une grille tarifaire de 2,00 $ par million de tokens en entrée et de 6,00 $ par million en sortie. Placer à côté de cela un GGUF de 2,09 GiB pour ordinateur portable, c'est une erreur de catégorie déguisée en page de comparatif.

Ce texte fait deux choses. Il corrige la comparaison que les résultats de recherche présentent de façon erronée, puis il répond à la version de la question que le lecteur se pose probablement en réalité : étant donné qu’un modèle de pointe est accessible en un seul appel API et qu’un spécialiste de la logique formelle s’exécute sur votre propre machine, quand chacun d’eux mérite-t-il sa place ?

Le modèle que la carte a réellement mesuré

La comparaison pertinente se fait avec Qwen3-8B, et le résumé qu'en donne webAI lui-même est plus modeste que ne le suggèrent les articles de seconde main. Le gate macro en domaine de TwIL-LM3-Pro est de 0,5539 contre 0,5336 pour Qwen3-8B, et la fiche du modèle contient la phrase qu'une page marketing aurait supprimée : l'avance sur le gate est de 0,020, « inférieure au bruit d'échantillonnage à n = 200 par voie — donc à interpréter comme une parité, pas comme une victoire. »

Là où la comparaison n’a rien d’un pile ou face : strict-7, 0,2879 contre 0,2093, une ligne qui n’utilise nulle part de crédit de correspondance approximative et ne peut donc pas être fabriquée par le formatage. Choix multiple strict, 0,4100 contre 0,0000. Induction de règles, 0,4195 contre 0,3680. Et le rapport de paramètres — 3,66B contre environ 8B — qui constitue à lui seul toute l’affirmation « moins de la moitié de la taille ».

Sur la suite de test retenue, webAI est encore plus direct : « TwIL-LM3-Pro n’y est pas en tête. » La macro sur dix jeux de données est de 0,7901, au niveau de sa propre base Granite et derrière les 0,8493 de Qwen3-8B. Un petit spécialiste qui égale un modèle généraliste deux fois plus grand que lui en logique formelle et qui lui cède sur les capacités générales correspond au profil attendu, et c’est en le présentant ainsi que le chiffre strict-7 devient crédible.

Ce qu'est réellement Qwen3.8-Max

Qwen3.8-Max n'est pas une itération de Qwen3-8B. Il s'agit du niveau premium d'Alibaba, et sur la page du catalogue OrcaRouter, il apparaît sous la référence `qwen/qwen3.8-max` avec une date de sortie au 3 août 2026, une fenêtre de contexte d'un million de tokens, une entrée texte, image et vidéo, une sortie texte, et une prise en charge complète du mode réflexion, de l'appel de fonctions, des outils intégrés et des sorties structurées. Il est servi via des tableaux de bord compatibles OpenAI, compatibles Anthropic et natifs dans cinq régions, et la réflexion s'active avec le paramètre `enable_thinking`. Le tarif est de 2,00 $ par million de tokens d'entrée et de 6,00 $ par million de tokens de sortie.

Un instantané daté, `qwen/qwen3.8-max-0902`, a été publié le 2 septembre 2026 avec les mêmes capacités et la même tarification, publié spécifiquement afin que le comportement puisse être figé pour des exécutions reproductibles. Si vous développez avec Qwen3.8-Max pour quoi que ce soit de longue durée, c’est cet identifiant d’instantané qu’il faut mettre dans la configuration plutôt que l’alias évolutif.

Notez ce qui est absent de cette description : un nombre de paramètres que vous pouvez télécharger, un fichier de licence, et le moindre moyen de l'exécuter vous-même. Qwen3.8-Max est un produit hébergé. La couverture journalistique au lancement faisait état de poids ouverts promis pour la semaine suivante, et la formulation de techsy — « 2,4 T de paramètres, 1 M de contexte, pas encore de poids » — correspond à un état que le lecteur devrait vérifier plutôt que présumer, car une promesse rapportée au lancement n'est pas un checkpoint publié.

Quatre dimensions, et aucune d’elles n’est proche

• Paramètres — TwIL-LM3-Pro 3,66 B dense, tous actifs, contre Qwen3.8-Max annoncé à 2,4 T au total dans une architecture à mélange d’experts clairsemé avec environ 95 B actifs par token. Trois ordres de grandeur sur le total, deux sur les actifs.

• Où il s'exécute — TwIL-LM3-Pro se télécharge en bf16 à 6,82 GiB ou en un GGUF Q4_K_M de 2,09 GiB pour CPU ou 4 Go de VRAM, contrairement à Qwen3.8-Max, qui n'existe que sous la forme d'un endpoint hébergé.

• Contexte — TwIL-LM3-Pro, 131 072 jetons, hérités de sa base Granite et jamais validés au-delà de 8 192 dans sa propre évaluation face à Qwen3.8-Max à 1 000 000 de jetons.

• Modalités — texte en entrée, texte en sortie vs texte, image et vidéo en entrée, texte en sortie.

• Licence — webAI Non-Commercial License ver. 1.0, avec un accord distinct requis pour une utilisation génératrice de revenus, contrairement à une API commerciale hébergée sans poids à concéder sous licence.

• Coût — TwIL-LM3-Pro : aucun frais par token et aucun point de terminaison hébergé, contre 2,00 $ par million de tokens en entrée et 6,00 $ par million de tokens en sortie pour Qwen3.8-Max, avec un tarif d'entrée mise en cache d'environ 0,25 $ par million.

Un modèle 3,66B est bon marché parce qu’il est petit, et il est petit parce qu’il fait une seule chose. Qwen3.8-Max est cher parce qu’il est généraliste et qu’il est hébergé. Aucun de ces tarifs n’est un verdict.

La question derrière la question

Si l’on écarte la confusion liée au nom, il reste une question d’ingénierie, et c’est une bonne question : si un modèle hébergé de pointe peut raisonner sur la logique formelle, pourquoi faire tourner un spécialiste étroit, tout court ?

Trois raisons tiennent la route. La première est la licence et le réseau : un groupe de recherche non commercial, un environnement isolé (air-gapped) ou une passe d’étiquetage par lots qui doit tourner sur un ordinateur portable sans connectivité ne peut pas appeler un point de terminaison hébergé, et un GGUF de 2,09 GiB répond directement à cette contrainte. La deuxième est la structure des coûts en fonction du volume — une tâche d’étiquetage en logique formelle portant sur un million d’entrées courtes est facturée au token sur un modèle de pointe hébergé et ne coûte que le temps d’exécution sur un modèle local. La troisième est la forme des sorties : TwIL-LM3-Pro a été ajusté pour émettre des structures vérifiables par machine plutôt que de la prose, et pour les étiquettes d’implication et les analyses sémantiques, c’est un pipeline plus court que de solliciter un modèle généraliste puis d’analyser sa réponse.

Face à cela, le cas de Qwen3.8-Max est simple. Il voit des images et de la vidéo, il gère un million de tokens, il prend en charge les outils et la sortie structurée via une API documentée, et il s’appuie sur des benchmarks publiés et une évaluation indépendante. Rien dans un spécialiste étroit ne menace cela ; les deux répondent à des ensembles de contraintes différents.

La stack qui utilise les deux

Le schéma qui survit au contact d’un vrai pipeline est à deux étages, et il n’a rien d’exotique. Un modèle hébergé de pointe lit l’entrée désordonnée — une page de manuel scannée, une source multimodale, une longue spécification — et la transforme en texte structuré propre. Ce texte va à un modèle local de logique formelle dont tout le travail est d’émettre une étiquette, une analyse syntaxique ou une critique Lean sur du matériel qui vous appartient. Le verdict sur la question de savoir si ce second étage vaut son coût de maintenance est la comparaison de style strict-7, et non le filtre, car un spécialiste gagne sa place sur les voies où la métrique ne laisse aucune place à une notation indulgente.

Il y a aussi un indice à retenir de la propre fiche de webAI : le pipeline a été exécuté sur cinq modèles de base différents, seul le coefficient de fusion changeant selon le modèle, et webAI rapporte le résultat pour chacun, y compris ceux qui ont le moins bougé. C’est une affirmation plus forte à propos d’une recette que n’importe quelle ligne de benchmark isolée, et c’est le genre de preuve qui indique qu’une méthode se généralise plutôt qu’un checkpoint n’a eu de la chance.

Qu'est-ce qui est routable ici, et qu'est-ce qui ne l'est pas ?

C'est le seul endroit où les deux modèles figurent honnêtement dans la même phrase. Qwen3.8-Max est une route : il est servi via OrcaRouter en tant que `qwen/qwen3.8-max`, et parce que la plateforme répercute le prix catalogue du fournisseur en ajoutant 0 % de marge, le tarif de 2,00 $/6,00 $ est celui du fournisseur et une baisse de prix de sa part est effective le jour même plutôt qu'après un cycle contractuel. L'instantané daté `qwen/qwen3.8-max-0902` est routable à ses côtés, de sorte que figer un identifiant de modèle reproductible relève d'un choix de configuration plutôt que d'une relation fournisseur distincte.

TwIL-LM3-Pro n’est pas une route, et il serait malhonnête de laisser entendre le contraire. Il est sous licence non commerciale sans point de terminaison hébergé publié, et la façon actuelle de l’utiliser consiste à télécharger le checkpoint et à l’exécuter vous-même. Ce que le routeur fait pour un pipeline construit autour de lui, c’est le travail textuel périphérique — l’expansion du prompt, la génération de corpus, la passe de filtrage — qui s’exécute sur le même point de terminaison compatible OpenAI face à plus de 200 modèles, de sorte que remplacer le modèle qui génère les données d’évaluation par le modèle qui les note ne coûte rien d’autre qu’une modification de configuration, avec basculement automatique pour maintenir un long lot en vie lorsqu’un fournisseur a un hoquet.

L'usage le plus défendable des deux ensemble est exactement celui-ci : un palier frontière routable qui assure le raisonnement général et l'extraction structurée, un spécialiste téléchargé qui assure le jugement en logique formelle, et une seule clé pour tout ce qui se trouve entre les deux.

Quel modèle comparer, et quand

Si vous évaluez de petits modèles de logique formelle, le Qwe​n qu’il vaut la peine de mettre à côté de TwIL-LM3-Pro est Qwen3-8B, et webAI a déjà publié cette comparaison avec les mises en garde qui l’accompagnent. Si vous choisissez où exécuter une charge de travail de production, Qwen3.8-Max est une décision entièrement différente — un système frontière hébergé avec une grille tarifaire et sans téléchargement — et la bonne question n’est pas de savoir lequel est meilleur, mais quelle contrainte s’impose : connectivité et licence d’un côté, contexte, modalité et échelle de l’autre. La plupart des systèmes réels finissent par avoir besoin des deux réponses.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement