Une carte de titre principale intitulée « L'un décide, l'autre décrit », avec le sous-titre « Liquid AI d1-omni-600M vs LFM2.5-VL-3B - poids ouverts, octobre 2026 », et deux cartes : Liquid AI d1-omni-600M à 587 M de paramètres renvoyant une étiquette ou un score avec 0 jeton de sortie, face à LFM2.5-VL-3B à 3,1 Md de paramètres qui rédige du texte et lit des images pour produire de la prose.
Guides & Insights

Liquid AI d1-omni-600M vs LFM2.5-VL-3B : L'un décide, l'autre décrit

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Liquid AI d1-omni-600M et LFM2.5-VL-3B sont tous deux petits, tous deux multimodaux, tous deux publiés par le même laboratoire sur Hugging Face sous la même licence lfm1.0 — et les associer constitue une erreur de catégorie qui s'avère utile. LFM2.5-VL-3B est arrivé le 12 août 2026 en tant que modèle vision-langage edge de Liquid AI : 3,1 milliards de paramètres, une fenêtre de 32 768 jetons et une sortie qui est de la prose. Donnez-lui une page numérisée et il renvoie la transcription, avec la mise en page, sous forme de texte. Liquid AI d1-omni-600M a été mis en ligne le 7 octobre 2026 avec le reste de la famille d1 ouverte, et il fait la chose opposée avec les mêmes entrées. C'est un modèle de décision de 587 M de paramètres : vous rattachez des questions nommées à un état et il rapporte ce qu'il croit déjà — P(oui), une étiquette choisie avec une confiance, une position sur une échelle ordonnée de deux à dix — en une seule passe avant, sans aucun jeton de sortie et rien à analyser en aval. Si vous avez cherché « le petit modèle multimodal Liquid », il y a désormais deux formes devant vous, et la forme, c'est la décision.

Cette page expose ce que les deux fiches de modèle, l’article de publication du 7 octobre et les dépôts eux-mêmes établissent réellement. Elle est également explicite sur l’endroit où ils s’arrêtent. Aucun élément de cette comparaison n’a été reproduit en dehors de Liquid AI et, pour l’un des deux modèles, le fournisseur n’a publié absolument aucun benchmark de précision spécifique à sa propre capacité phare.

Les deux points de contrôle, côte à côte

Les fiches techniques divergent sur presque tous les axes, ce à quoi on s'attendrait de la part de deux modèles qui n'étaient pas censés se disputer le même créneau.

• De quoi il s'agit — LFM2.5-VL-3B est un modèle génératif vision-langage qui écrit du texte ; Liquid AI d1-omni-600M est un modèle de décision qui renvoie des réponses structurées et n'émet aucun token

• Paramètres — 3,1 Md en BF16 pour LFM2.5-VL-3B contre 587 M pour Liquid AI d1-omni-600M, lui-même constitué d’un tronc partagé et d’une tête de décision de 381 M, plus un encodeur visuel de 94 M et un encodeur audio de 112 M

• Backbone — LFM2.5-VL-3B associe un modèle de langage LFM2.5-2.6B à un encodeur visuel SigLIP2 NaFlex de 400M optimisé pour la forme ; Liquid AI d1-omni-600M est entraîné à partir de LFM2.5-Encoder-350M, un encodeur bidirectionnel, avec une tour SigLIP2 issue de LFM2.5-VL-450M et un FastConformer à 17 couches pour l’audio

• Entrées — texte et images pour LFM2.5-VL-3B ; texte plus images ou du texte plus jusqu’à 30 secondes de parole pour Liquid AI d1-omni-600M, qui déclenche une ValueError si des images et de l’audio arrivent dans la même requête

• Contexte — 32,768 tokens pour LFM2.5-VL-3B contre 16,384 positions combinées de texte, d’image et d’audio pour Liquid AI d1-omni-600M, dont la fiche ajoute qu’en présence d’images, le texte d’état et de question est réduit à 896 tokens pour correspondre à l’entraînement

• Vocabulaire — 128 000 tokens pour LFM2.5-VL-3B, 65 536 pour Liquid AI d1-omni-600M

• Runtime — LFM2.5-VL-3B s'exécute dans transformers et vLLM et dispose d'un modèle draft DSpark distinct pour le décodage spéculatif, Liquid AI d1-omni-600M est livré avec du code personnalisé, nécessite trust_remote_code=True, et sa fiche recommande float16 sur GPU tout en avertissant que bfloat16 a modifié la réponse principale sur certaines lignes

• Licence — lfm1.0 pour les deux, ce qui permet le fine-tuning et le déploiement

Une ligne de cette liste fait plus de travail que toutes les autres. Liquid AI d1-omni-600M repose sur un encodeur bidirectionnel plutôt que sur un décodeur. Ce n'est pas une réduction de taille de LFM2.5-VL-3B ; c'est une lignée différente, et c'est la raison architecturale pour laquelle les deux modèles ne peuvent pas être interchangés l'un avec l'autre, quelle que soit la façon dont on lit les tableaux de benchmarks.

Le contrat de sortie décide davantage que les benchmarks ne le font

Posez à LFM2.5-VL-3B une question sur une image et vous obtenez du langage en retour. Cela vaut de l'argent lorsque la réponse doit être lue par une personne, consignée sous forme de chaîne de caractères ou transmise à une étape qui attend de la prose. C'est aussi une contrainte qu'il faut prendre en compte dans l'ingénierie : la sortie générée peut divaguer, une requête au format JSON peut revenir structurée différemment de ce que vous avez demandé, et chaque token est facturé et attendu. Le modèle est explicitement conçu pour un travail de vision à tour unique, à haut débit et à faible latence — OCR par lots de documents numérisés, détection en temps réel dans un véhicule, traduction embarquée de la signalisation — et explicitement écarté des questions à long contexte et à forte intensité de raisonnement, telles que « qu'est-ce qui ne va pas dans ce plan ? »

Liquid AI d1-omni-600M répond à une question strictement plus étroite dans une enveloppe strictement plus fiable. Son interface est un état — texte, JSON, une ou plusieurs images, ou jusqu'à 30 secondes de parole — plus un ensemble de questions nommées, chacune déclarant son propre type. Un booléen est une question oui/non et revient sous la forme P(oui) entre 0 et 1. Un choix est une question qui sélectionne une étiquette dans un ensemble que vous nommez et renvoie l'étiquette, une confiance et la probabilité de chaque option. Un score est une question qui place l'état sur une échelle ordonnée de deux à dix niveaux et renvoie le niveau attendu avec sa distribution. Plusieurs questions peuvent être rattachées à un même état et sont lues en une seule passe, de sorte que le compteur d'utilisation de la fiche modèle indique output_tokens : 0. Il n'y a pas d'étape de génération, ce qui signifie qu'il n'existe pas de sortie qui échoue à l'analyse.

Ce à quoi vous renoncez, c’est tout ce qu’une réponse générée porte et qu’une étiquette ne porte pas : le raisonnement, la réserve, la phrase que vous pouvez coller dans un ticket, la possibilité de poser une question de suivi dans la même conversation. Liquid le dit sans détour — le modèle n’est pas un modèle de chat et n’écrit pas de texte. Si votre pipeline a besoin d’une explication à côté du verdict, Liquid AI d1-omni-600M est la mauvaise moitié de la paire, et la réponse honnête est d’exécuter les deux : LFM2.5-VL-3B pour produire la lecture de l’image, Liquid AI d1-omni-600M pour produire la décision à son sujet.

A two-column scoreboard for Liquid AI d1-omni-600M and LFM2.5-VL-3B showing the 600M at 587M parameters, output of label, score and 0 tokens, text plus image or audio input, no published vision benchmark, up to 30 seconds of speech and a 16,384-token context, against the 3B at 3.1B parameters, generated text output, text plus image input, RefCOCO 87.9 and OCRBench v2 47.5 on vision, no audio and a 32,768-token context, footed 'All figures vendor-reported by Liquid AI; none independently reproduced. October 2026.'

Il n'existe pas de chiffre de vision en comparaison directe, et c'est là la conclusion

Le réflexe suivant consiste à aligner les benchmarks de vision. Impossible. Sur LFM2.5-VL-3B, le fournisseur publie une série complète — RefCOCO Macro Precision@1 à 87,9, ScreenSpot-v2 à 80,7, ChartQA à 81,3, POPE à 88,7, MMStar à 63,3, BLINK à 61,5, MuirBench à 58,3, ToolSandBox à 59,5, OCRBench v2 en anglais à 47,5, et un RealWorldQA de 73,1 qui dépasse de peu les 71,1 du précédent LFM2-VL-3B. Tous ces chiffres sont rapportés par le fournisseur, aucun n’a été réexécuté indépendamment, et ils n’en restent pas moins des affirmations précises sur des capacités précises que le lecteur peut utiliser pour demander des comptes au laboratoire.

Pour Liquid AI d1-omni-600M, l'article de lancement indique que le Decision Index v0.3 inclut un split vision privé « dont nous ne rendons pas compte dans cette version », et qu'à la place, Liquid a validé que le checkpoint 600M « gère les trois modalités », les preuves étant placées dans des démos du playground. C'est l'intégralité du bilan vision publié. Il n'y a aucun chiffre de benchmark d'image pour ce checkpoint, ni dans sa fiche de modèle ni dans l'article de lancement. Le même article confirme ce qui manque du côté audio de manière encore plus directe : les benchmarks de décision audio dédiés sont, selon les propres mots du fournisseur, « actuellement un problème ouvert ».

Ainsi, la bonne lecture de cette confrontation est asymétrique et doit être formulée comme telle. LFM2.5-VL-3B a démontré une capacité de vision, chiffres à l’appui. Liquid d1-omni-600M dispose d’un encodeur visuel emprunté à un modèle frère, d’un adaptateur entraîné face à un backbone gelé, d’une démo et d’une promesse. Si votre déploiement a besoin que le modèle soit fiable sur les images ce mois-ci, le 3B est le seul des deux à avoir quoi que ce soit sur quoi s’appuyer.

Vitesse : un seul de ces éléments a été mesuré.

Parce qu’un modèle décisionnel ne génère rien, la latence est le chiffre qui compte, et là encore, un seul côté est documenté. Le LFM2.5-VL-3B est annoncé à 228 jetons par seconde sur un Apple M5 Max et à 116 jetons par seconde sur un AMD Ryzen AI Max+ 395, tous deux dans 3,3 Go de mémoire, avec environ 20 jetons par seconde sur un Galaxy S26 Ultra et environ 11 000 jetons par seconde sur un seul H100 sous vLLM. Ces chiffres décrivent le débit de décodage, qui est la mesure appropriée pour un modèle qui écrit.

Pour Liquid AI d1-omni-600M, la fiche indique que les chiffres d'inférence ne sont pas communiqués parce que le modèle est une version de recherche précoce et en cours de développement actif. Le modèle frère d1-3B de la même famille dispose, lui, de tableaux de latence — 8 ms pour une question sur une RTX 4090, 16 ms sur un Jetson AGX Thor, 26 ms sur un Jetson AGX Orin 64 Go, 50 ms sur un Orin Nano, trois questions sur un même état coûtant environ 1,3 fois le temps d'une seule. Ces chiffres appartiennent au modèle de décision 3B et ne doivent pas être transposés au 600M. Pour Liquid AI d1-omni-600M, la position honnête est que l'architecture implique un modèle petit et rapide et que personne en dehors du laboratoire n'a publié de chiffre en millisecondes.

L'empreinte des poids peut au moins être estimée. À la précision float16 que la carte recommande, 587 M de paramètres représentent environ 1,2 Go de poids avant les activations — un calcul arithmétique sur le nombre de paramètres publié, et non une mesure du fournisseur —, face aux moins de 3,3 Go que Liquid annonce pour LFM2.5-VL-3B. Sur un appareil où les mégaoctets sont la contrainte, cet écart est l'argument en faveur du 600M.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

Comment choisir entre eux

Le choix se résout sans ambiguïté dès lors que le contrat de sortie est considéré comme fixe plutôt que négociable.

Privilégiez LFM2.5-VL-3Blorsque le livrable est du texte : OCR pleine page avec annotation de mise en page, ancrage et détection à partir de requêtes en langage naturel, traduction de signalétique sur un appareil, toute étape où un humain ou un modèle de langage en aval consomme la réponse. Il dispose aussi d'un contexte plus large, à 32 768 tokens, et d'une couverture linguistique plus approfondie en pratique, car ses réponses sont du langage plutôt que des étiquettes.

Recourez à Liquid AI d1-omni-600M lorsque le livrable est une décision : router un ticket, trier une image, modérer un clip, contrôler un garde-fou, noter une réponse sur une échelle de deux à dix — et, cas unique entre ces deux modèles, lorsque l'entrée est de la parole. C'est le seul des deux qui accepte l'audio, tout court, jusqu'à 30 secondes par requête, bien que sa fiche indique que l'audio a été entraîné sur des échanges entre un locuteur anglophone et un assistant, ce qui est une description restrictive du monde d'où proviendront vos appels.

Ne vous tournez vers aucun des deux, et restez avec un modèle vision-langage général, si la tâche exige de raisonner sur l’image plutôt que d’en faire une lecture ou d’en tirer un verdict. Les deux fiches de modèle écartent ce cas d’usage, et Liquid AI d1-omni-600M n’a aucun mécanisme pour s’y essayer.

Essayer un checkpoint expérimental sans miser le pipeline dessus

Liquid AI d1-omni-600M est, selon l'appellation du fournisseur lui-même, une version de recherche préliminaire, et son comportement en vision et en audio ne fait l'objet d'aucun benchmark. C'est exactement le profil d'un modèle que vous voulez évaluer derrière un mécanisme de repli plutôt que devant les clients. OrcaRouter achemine plus de 200 modèles via une seule clé API avec basculement automatique entre fournisseurs, ce qui est la manière économique de mettre un checkpoint comme celui-ci sur un chemin en production : si la route expérimentale se dégrade ou qu'un fournisseur tombe en panne, la requête atterrit sur le repli sans modification de code. La même clé porte chaque modèle auquel le pipeline passe la main, au prix catalogue de chaque fournisseur, répercuté avec 0 % de marge, donc une baisse de prix d'un fournisseur est votre prix le jour même.

Une mise en garde, formulée parce qu'elle est essentielle : les modèles ouverts d1 et la famille LFM2.5-VL ne figurent pas dans notre catalogue aujourd'hui. L'auto-hébergement des poids est la voie que le fournisseur recommande pour les deux, avec un support de llama.cpp dès le premier jour sur le matériel Apple, AMD, Qualcomm et NVIDIA, et les exécuter sur un point de terminaison hébergé implique l'API du fournisseur lui-même ou des plateformes tierces. Interpréter cette page comme une affirmation de disponibilité serait une erreur.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

Que regarder

La question intéressante n'est pas de savoir si le 600M finira par surpasser le 3B en quoi que ce soit — ce ne sera pas le cas, et il n'a pas été conçu pour cela. C'est de savoir si Liquid AI publie le split de vision privé qu'elle a retenu, et si quelqu'un construit le benchmark de décision audio que le laboratoire dit ne pas encore exister. Tant qu'aucun des deux n'arrive, une comparaison entre Liquid AI d1-omni-600M et LFM2.5-VL-3B est une comparaison entre un modèle mesuré et un modèle plausible. Pour les travaux non mesurés — de la parole en entrée, un verdict en sortie, assez petit pour tenir sur l'appareil — le 600M est le seul checkpoint à poids ouverts de cette famille à s'y essayer, et être premier sans tableau de scores, c'est encore être premier.

OrcaRouter achemine plus de 200 modèles via une seule clé API, avec le prix catalogue de chaque fournisseur répercuté avec 0 % de marge, si bien qu'une baisse de prix d'un fournisseur devient votre prix le jour même.