Une carte de titre principale affichant « Intern-Decision-0.8B vs LFM2.5 2.6B Base », avec le sous-titre « Deux façons de construire quelque chose soi-même », portant les badges « l’une renvoie une distribution » et « l’autre renvoie une exécution d’entraînement », avec le logo OrcaRouter incrusté dans le coin.
Guides & Insights

Intern-Decision-0.8B vs LFM2.5 2.6B Base : deux façons de construire quelque chose soi-même

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Placez Intern-Decision-0.8B à côté de LFM2.5 2.6B Base, et la première observation honnête est que ni l'un ni l'autre n'est un produit au sens où un acheteur l'entend habituellement. Intern-Decision-0.8B est le checkpoint qu'InternLM a mis en ligne sur Hugging Face le 26 septembre 2026 sans la moindre annonce — un fine-tune de 852 985 920 paramètres de Qwen3.5-0.8B qui répond à des questions saisies au clavier et n'émet aucun texte, distribué sous Apache 2.0 avec un lien GitHub qui renvoie une 404. LFM2.5 2.6B Base est le checkpoint de texte pré-entraîné de 2,69 milliards de paramètres de Liquid AI, publié le 1er août 2026 comme fondation de la famille LFM2.5, et sa propre fiche indique qu'il est « uniquement recommandé pour les tâches qui nécessitent un fine-tuning poussé ». L'un est fini et étroit. L'autre est inachevé et généraliste. Tous deux partent du principe que c'est vous qui faites le travail — et le travail n'est pas le même.

Cette distinction constitue toute la comparaison, et c’est la raison pour laquelle un simple tableau de spécifications serait trompeur. La question que se pose réellement un lecteur est « lequel de ces éléments dois-je télécharger », et la réponse dépend de si ce que vous devez construire est une couche de décision ou une capacité linguistique. Ce sont des projets différents avec des calendriers différents.

Ce que chaque modèle vous remet

Intern-Decision-0.8B se présente comme un système fonctionnel. Le dépôt fournit inference.py, une DecisionEngine classe, un schéma de requête documenté et un schéma de réponse, ainsi qu’un exemple concret que vous pouvez exécuter après avoir installé quatre dépendances Python épinglées. Vous fournissez un état, une à seize questions nommées avec jusqu’à 62 options chacune, et éventuellement jusqu’à huit images, et vous obtenez en retour une distribution calibrée plus une étiquette argmax par champ. Le moteur lit les logits à des positions fixes dans un squelette pré-rendu plutôt que de générer quoi que ce soit, donc il n’y a pas d’étape de décodage, pas de tokens de sortie et pas de JSON à réparer. Il fonctionne à partir d’environ 1,73 Go de fichiers.

LFM2.5 2.6B Base vous offre l'inverse : une capacité brute, sans interface. Il s'agit d'un modèle de langage causal exclusivement textuel, composé de 30 couches organisées en 22 blocs de convolution courte à double porte et 8 couches d'attention à requêtes groupées, pré-entraîné sur environ 34 000 milliards de tokens dans 16 langues, avec un vocabulaire de 128 000 tokens et une fenêtre de contexte de 131 072 tokens. Il ne dispose pas de son propre affinage par instruction ni de benchmarks de tâches sur la fiche, car un checkpoint de base n'est pas évalué — ce sont les modèles que vous entraînez à partir de lui qui le sont. Le pipeline de post-entraînement propre à Liquid est ce qui le transforme en LFM2.5-2.6B agentique, et ce pipeline est ce que l'on vous demande de reproduire, partiellement ou intégralement, pour votre propre domaine.

Donc l'axe n'est pas la taille. C'est de savoir si la pièce manquante est un contrat de décision ou une exécution d'entraînement.

Le tableau des scores, avec les réserves qui s’y rattachent

• Temps jusqu'au premier résultat — Intern-Decision-0.8B : un après-midi, charger un checkpoint et appeler predict()/. LFM2.5 2.6B Base : quelle que soit la durée de votre pré-entraînement continu ou de votre session SFT, plus le travail sur les données pour le préparer.

• Paramètres — Intern-Decision-0.8B : 852 985 920 répartis sur un shard linguistique de 1,50 Go, un shard de vision de 176 Mo et un projecteur de 25 Mo. LFM2.5 2.6B Base : 2,69 milliards, environ 2,5 Go de poids.

• Modalités d'entrée — Intern-Decision-0.8B : texte plus jusqu'à huit images, avec les poids de vision présents dans le dépôt. LFM2.5 2.6B Base : texte uniquement, par conception — le travail multimodal de la famille LFM2.5 réside dans les variantes VL.

• Contexte pratique — Intern-Decision-0.8B : 8 192 jetons, rejetés plutôt que tronqués, malgré un embedding positionnel maximal de 262 144 dans la configuration. LFM2.5 2.6B Base : 131 072 jetons natifs.

• Sortie — Intern-Decision-0.8B : une distribution de probabilités calibrée et une étiquette argmax par champ, déterministe. LFM2.5 2.6B Base : texte continué, échantillonné.

• Benchmarks — Intern-Decision-0.8B : un tableau complet du fournisseur sur sept benchmarks, non reproduit par quiconque. LFM2.5 2.6B Base : aucun publié pour la base elle-même, par conception.

• Licence — Intern-Decision-0.8B : Apache 2.0, avec conservation du LICENSE-QWEN/ pour les poids amont. LFM2.5 2.6B Base : LFM Open License v1.0.

A two-column scoreboard comparing Intern-Decision-0.8B with LFM2.5 2.6B Base on six shared rows: parameters 852,985,920 against 2.69B in about 2.5 GB, what you get a working engine and a documented schema against raw pre-trained weights with no interface, time to first result an afternoon against a continued pre-training or SFT run, input text plus up to eight images against text only with a 131,072-token context, benchmarks a vendor table unreproduced against none published for the base, and licence Apache 2.0 plus LICENSE-QWEN against the LFM Open License v1.0 and its $10M threshold.

La ligne de licence mérite sa propre section

Les deux cartes indiquent « open », et ces deux mots ont des sens substantiellement différents. Intern-Decision-0.8B est sous Apache 2.0 — aucune condition de revenus, aucune restriction de domaine d’utilisation, aucune licence commerciale distincte à négocier. Le second fichier de licence du dépôt est la licence Qwen reconduite, car le modèle est un dérivé de Qwen3.5-0.8B, ce qui est la bonne façon de procéder plutôt qu’une limitation.

LFM2.5 2.6B Base est distribué sous la licence LFM Open License v1.0, et il vaut la peine de lire intégralement la section 5 de cette licence avant qu'un quelconque projet commercial ne repose sur elle. Les droits accordés au titre de l'Usage Commercial sont subordonnés à la condition que vous, ou votre entité juridique, ne dépassiez pas un seuil défini dans la licence comme un chiffre d'affaires annuel de 10 millions de dollars américains ou plus. Au-delà de ce seuil, l'utilisation commerciale de l'œuvre ou d'un dérivé n'est pas concédée sous licence par l'accord. Les utilisations à but non lucratif et à des fins de recherche font l'objet d'une exception. Il s'agit d'une limite réelle et opposable, et comme elle s'applique aussi aux œuvres dérivées, elle se propage à tout ce que vous affinez à partir de la base — ce qui constitue l'usage prévu de ce checkpoint.

Il y a une lecture simple ici : si vous développez à des fins commerciales et que votre entité dépasse 10 M$ de chiffre d’affaires annuel, LFM2.5 2.6B Base n’est pas le même type d’actif que Intern-Decision-0.8B, indépendamment de leurs performances respectives. Si vous êtes sous le seuil, que vous faites de la recherche ou du fine-tuning à des fins non commerciales, la distinction n’a pas d’incidence. Dans un cas comme dans l’autre, c’est une question à trancher avant la session d’entraînement, pas après.

Où chacun est en fait le bon téléchargement

LFM2.6B Base est le bon choix lorsque la capacité dont vous avez besoin n'existe pas encore dans un modèle finalisé. La carte de Liquid énumère explicitement les cas d'usage prévus : des assistants spécifiques à une langue comme le japonais, des assistants spécifiques à un domaine comme le médical, l'entraînement sur des données propriétaires que vous ne pouvez pas envoyer à une API, ou l'expérimentation de nouvelles approches de pré-entraînement. Le raisonnement derrière cette liste est que 34 billions de tokens de pré-entraînement multilingue sont coûteux à reproduire et presque gratuits à hériter — vous achetez un point de départ déjà compétent dans 16 langues et un contexte de 128K, et vous consacrez votre propre puissance de calcul à la partie qui vous est spécifique.

La prise en charge par l’écosystème de ce plan est d’une complétude inhabituelle pour un modèle aussi récent. Liquid documente le pré-entraînement continué, le SFT, le DPO et le GRPO via Unsloth et TRL, avec des notebooks pour chacun, et le checkpoint est pris en charge par Transformers, vLLM, SGLang, llama.cpp, MLX et LM Studio. Ce n’est pas du texte marketing — c’est la différence entre un modèle de base que vous pouvez fine-tuner cette semaine et un autre que vous passez quinze jours à intégrer tant bien que mal dans un framework d’entraînement.

Intern-Decision-0.8B est le bon choix lorsque la capacité dont vous avez besoin existe déjà et que le problème tient à sa forme. Si votre tâche est une décision bornée avec un ensemble fermé de réponses — acheminer ce ticket, scorer cette réclamation, classer cet enregistrement selon une grille d’évaluation —, alors un modèle génératif est une façon maladroite d’obtenir une étiquette, et un modèle de base n’est pas du tout un moyen d’en obtenir une. Ce que vous voulez, c’est quelque chose qui renvoie la distribution, vous indique son niveau de confiance et le fait dans les mêmes 34 millisecondes à chaque fois. La latence mesurée d’InternLM sur une seule RTX 4090 est de 33,98 ms en moyenne, avec un p95 de 37,50 ms, et les chiffres de la carte elle-même montrent que le modèle frère 2B est à 33,28 ms en moyenne — un rappel qu’à ces longueurs de prompt, le coût réside dans la lecture du schéma, pas dans l’exécution des poids.

Le compromis que vous faites, c’est d’échanger de la flexibilité contre un contrat. Un modèle de base peut devenir n’importe quoi, à terme, si vous avez les données et la puissance de calcul. Une tête de décision est déjà ce qu’elle est, et elle ne deviendra jamais autre chose. Si votre schéma change de forme chaque mois, c’est un coût bien réel. Si ce n’est pas le cas, ce n’est pas un coût du tout.

Ce que personne ne peut vous dire sur la table Intern-Decision

Chaque chiffre de performance pour Intern-Decision-0.8B est déclaré par le fournisseur, et la mise en garde ici est plus lourde que d’habitude, car la version date d’une semaine et est totalement dépourvue de documentation. Il n’y a aucun article, aucune collection rassemblant les trois tailles, aucun dépôt GitHub fonctionnel et aucune évaluation indépendante. Une recherche sur Artificial Analysis ne renvoie rien pour le modèle.

InternLM a sélectionné les benchmarks, a choisi les modèles de comparaison — un ensemble dominé par des modèles décisionnels, notamment Jev de TypeSafe, Laya et Kev de Convai — et a publié le tableau sans billet de lancement.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Avec cette étiquette attachée, la forme reste intéressante à lire. Intern-Decision-0.8B affiche 97,92 / 80,56 / 52,25 sur les trois splits de Jevbench, 77,35 sur Typed Decision et 94,52 sur ToolACE, soit une moyenne de 79,38. Son profil de calibration est l’entrée la plus intéressante : un Brier de 0,530 et une erreur de calibration attendue de 0,066, soit un ECE meilleur que celui de Jev (0,095) malgré un Brier moins bon. En clair, il est moins précis mais plus honnête sur sa propre précision, et pour un workflow basé sur des seuils, cet ordre compte plus que la moyenne. La colonne qui devrait empêcher un déploiement est WildJailBreak, à 64,48 contre 96,29 pour Jev. Un déficit de robustesse des refus aussi important est une propriété du fine-tuning, et savoir s’il tient à la base Qwen3.5-0.8B, à l’objectif de réglage décisionnel ou au nombre de paramètres n’est documenté nulle part sur la fiche.

La comparaison avec LFM2.5 2.6B Base sur cet axe ne consiste pas à savoir « qui obtient le meilleur score », car le base n'a aucun score. C'est que les chiffres d'un modèle ne sont pas audités et que les chiffres de l'autre modèle n'existent pas, et un lecteur qui choisit entre eux choisit avec quel type d'inconnu composer.

Le pipeline que la plupart des gens finissent en réalité par construire

Il existe une configuration qui utilise les deux, et elle mérite d’être nommée, car c’est là que la plupart des systèmes de production aboutissent. La couche de décision traite les appels fermés — triage, routage, notation par grille — où l’ensemble des réponses est connu, où la latence s’accumule sur un million d’enregistrements et où les tokens de sortie sont du pur surcoût. La couche linguistique traite tout ce qui nécessite de la prose, de la synthèse ou un contexte long : le résumé d’escalade, l’explication attachée à l’étiquette, le brouillon qu’un humain modifie. LFM2.5 2.6B Base est un substrat plausible pour la seconde moitié si vous disposez de données de domaine qui valent la peine de servir à l’entraînement ; une tête de décision est la forme naturelle de la première.

Composer les deux est la partie délicate, et c'est la partie qu'il vaut mieux ne pas construire à la main. Le DSL de routage d'OrcaRouter exprime le routage sous forme de code — du YAML avec des conditions CEL, déployé sans redéploiement — de sorte qu'un pipeline qui envoie une classe de requêtes vers un point de terminaison de décision et une autre vers un modèle de langage est une règle de routage plutôt qu'un répartiteur de charge que vous maintenez vous-même. La passerelle couvre plus de 200 modèles derrière une seule clé compatible OpenAI, avec le prix catalogue du fournisseur répercuté sans marge, et elle n'ajoute pas de marge sur le modèle que vous choisissez. Pour être précis sur la frontière : ni Intern-Decision-0.8B ni LFM2.5 2.6B Base n'est l'un des nôtres — ce sont tous deux des checkpoints que vous téléchargez et exécutez localement, et dans les deux cas c'est précisément l'objectif, car la raison de choisir un modèle de 2 Go est qu'il s'exécute là où vos données se trouvent déjà. Ce à quoi sert une passerelle, c'est à gérer la moitié de la pile que vous devriez sinon appeler à l'extérieur.

Si la couche de décision est l’élément que vous souhaitez tester sans engager une exécution d’entraînement, un modèle de décision hébergé est l’expérience la moins coûteuse, et Jev 1.13 de TypeSafe est celui contre lequel InternLM a établi son benchmark — accessible dès aujourd’hui via un unique point de terminaison compatible OpenAI à 0,042 $ par million de jetons d’entrée, les sorties étant facturées à zéro.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Lequel, alors

Choisissez LFM2.5 2.6B Base si la capacité n'existe pas encore et que vous disposez à la fois des données du domaine et de l'appétit pour une campagne de fine-tuning, et vérifiez le seuil de 10 M$ de chiffre d'affaires dans la LFM Open License avant de bâtir dessus à des fins commerciales. Choisissez Intern-Decision-0.8B si la capacité existe, que les réponses sont déjà énumérables dans votre prompt, et que ce dont vous avez besoin est un moyen rapide, déterministe et sans problèmes de licence d'obtenir le label — en acceptant que sa documentation soit absente, que ses benchmarks ne soient pas audités et que son comportement de refus face à des entrées adverses n'ait été testé par personne en dehors du laboratoire qui l'a ajusté. Le second est le chemin le plus court et l'inconnue la plus grande. Le premier est le chemin le plus long et le plus documenté, et aucun de ces faits n'équivaut à « meilleur ».