Carte de titre hero pour LFM2.5-VL-3B, titrée « LFM2.5-VL-3B » avec le sous-titre « Le modèle vision-langage 3B de Liquid AI pour l'edge », une pastille « Nouveau — expédié le 11 août 2026 », et trois icônes en trait fin (cadre photo, paragraphe, œil).
Guides & Insights

LFM2.5-VL-3B : le nouveau modèle vision-langage 3B de Liquid AI pour l'edge

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La première chose à savoir sur LFM2.5-VL-3B, c'est qu'il est sorti en deux demi-étapes. Les poids sont apparus sur Hugging Face le 11 août 2026 — un checkpoint bf16 complet, une fiche de modèle avec un tableau de benchmarks et un README en seize langues, et aucune annonce jointe. La fiche affichait zéro téléchargement. Le lendemain, le 12 août, Liquid AI a publié l'article officiel, « LFM2.5-VL-3B : un modèle vision-langage meilleur et plus rapide pour l'edge », et la sortie discrète est devenue une vraie sortie. Si vous lisez ceci la même semaine, vous lisez l'un des tout premiers articles indépendants sur un modèle que presque personne en dehors du laboratoire de Liquid n'a encore fait tourner — voici donc ce qui est réellement connaissable depuis le dépôt, et ce qui ne l'est pas.

Ce qu'est LFM2.5-VL-3B

LFM2.5-VL-3B est un {{1}}modèle vision-langage{{/1}} — {{2}}images et texte en entrée, texte en sortie{{/2}} — construit sur le {{3}}backbone texte LFM2.5{{/3}} de Liquid AI. Concrètement : le modèle de langage est le {{4}}LFM2.5-2.6B{{/4}}, associé à un {{5}}encodeur de vision SigLIP2 NaFlex 400M{{/5}}, pour environ {{6}}3,1 milliards de paramètres au total{{/6}}. Il conserve l'{{7}}architecture hybride{{/7}} de la famille : des {{8}}blocs de convolution à portes à courte portée{{/8}} entrelacés avec l'{{9}}attention par requêtes groupées{{/9}}, {{10}}un vocabulaire de 128 000 jetons{{/10}} et {{11}}une fenêtre de contexte de 32 768 jetons{{/11}}. Il prend en charge {{12}}seize langues{{/12}} (anglais, arabe, chinois, français, allemand, hindi, indonésien, italien, japonais, coréen, polonais, portugais, russe, espagnol, thaï, vietnamien), est fourni en {{13}}bfloat16{{/13}} et est sous la {{14}}licence ouverte lfm1.0{{/14}} de Liquid.

Ce n'est pas un modèle créé de zéro. La fiche le décrit comme une variante multimodale de LFM2.5 qui s'appuie sur le précédent LFM2-VL-3B avec des phases supplémentaires d'entraînement intermédiaire et de post-entraînement. Cette filiation compte : les compétences visuelles sont superposées à un modèle de texte déjà pré-entraîné sur environ 34 billions de jetons, de sorte que le côté langage n'est pas un jouet — c'est le même moteur que celui des modèles de texte, avec un encodeur visuel soudé et ré-entraîné pour la vision.

Ce qu'il peut faire

L'analyse de Liquid met en avant quatre améliorations par rapport au précédent LFM2-VL-3B : la compréhension de l'écran et de l'interface utilisateur, l'appel de fonctions, le grounding et l'entrée multi-image. En termes simples, cela signifie :

• Grounding — pointez des objets avec des requêtes en langage naturel (« le panneau stop », « la colonne de prix ») et obtenez un emplacement normalisé en retour.

• {{1}}Compréhension de l'écran{{/1}} — répondre à des questions sur ce qui est à l'écran et où, évalué sur ScreenSpot-v2.

• OCR avec annotation de mise en page — OCR pleine page qui renvoie également la structure du document, avec 23 étiquettes de mise en page (texte, titre, liste, tableau, légende de tableau, graphique, équation, code, en-têtes et pieds de page, etc.) sous forme de coordonnées entières normalisées.

• Utilisation d'outils — un flux d'appel de fonctions en quatre étapes qui prend des définitions d'outils en JSON, émet des appels pythoniques entre les jetons d'appel d'outils, et renvoie une réponse finale en texte brut.

• Entrée multi-image — raisonner sur plusieurs images en un seul tour.

Les propres recommandations de Liquid quant aux domaines où il n'est pas adapté sont inhabituellement précises. La fiche le recommande pour des tâches à tour unique, à haut débit et à faible latence — détection d'objets quasi en temps réel dans l'automobile, OCR par lots de documents numérisés, traduction de menus et de panneaux routiers sur l'appareil — et met explicitement en garde contre les travaux à long contexte exigeant un raisonnement approfondi, la conception visuelle de sites web et les questions de plans techniques très spécialisés.

Les chiffres — tous rapportés par les fournisseurs

Chaque figure de cette section provient de la carte de modèle et de l'article de blog de Liquid AI. Rien de tout cela n'a été reproduit de manière indépendante, et tant qu'un tiers n'aura pas exécuté le checkpoint, vous devez traiter ces éléments comme des affirmations, pas des faits. Cette étiquette fait ici un vrai travail, car le bilan est effectivement solide sur le papier :

• Grounding — précision macro@1 de RefCOCO de 87,9, en hausse par rapport à 57,1 sur le précédent LFM2-VL-3B — un bond d'environ trente points que Liquid attribue au post-entraînement de la vision.

• Compréhension de l'écran — moyenne ScreenSpot-v2 de 80,7, que Liquid présente comme supérieure au 78,5 qu'ils attribuent à Qwen3.5-4B.

• Utilisation d'outils — ToolSandbox 59,5, plus du double des 26,4 Liquid mesurés sur LFM2-VL-3B ; BFCLv4 32,5, en hausse par rapport à 20,5.

• Raisonnement visuel général — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.

• OCR — OCRBenchv2 (sous-ensemble anglais) 47.5, en hausse par rapport à 43.9.

• Raisonnement multimodal difficile — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — le point le plus faible, comme prévu pour un modèle 3B.

• Vitesse, tests du fournisseur — 228 tokens/s sur un Apple M5 Max, 116 tokens/s sur un AMD Ryzen AI Max+ 395, et 20 tokens/s sur un Galaxy S26 Ultra, le tout dans environ 3,3 Go de mémoire. Sur un H100 avec vLLM, Liquid annonce environ 11K tokens/s en sortie à forte concurrence et un délai avant le premier token d'environ 34 ms sur un clip de cinq images, ce qu'il attribue au fait que le modèle répond directement au lieu de raisonner.

Scoreboard for LFM2.5-VL-3B with one column: Params 3.1B (2.6B LM + 400M vision), Context 32,768 tokens, Vision encoder SigLIP2 NaFlex 400M, Grounding RefCOCO 87.9, Screen understanding ScreenSpot-v2 80.7, Status no hosted endpoint yet. Footer: 'All benchmark figures vendor-reported; no independent scores yet.'

Ce sont beaucoup d’affirmations pour un seul modèle 3B, et il vaut la peine de répéter l’avertissement en bas de la fiche du modèle lui-même : ce sont les chiffres de Liquid. L’écart entre « obtient de bons résultats dans une évaluation en laboratoire » et « tient la route sur vos données » est exactement l’endroit où un modèle aussi nouveau se fait généralement prendre.

Ce qui n'est pas encore connu

La liste honnête des questions ouvertes :

• Aucun benchmark indépendant — au moment de la rédaction, LFM2.5-VL-3B n'apparaît sur aucun classement tiers. Tous les scores ci-dessus sont rapportés par le fournisseur.

• Aucun point de terminaison hébergé — aucun fournisseur d'inférence ne le sert encore. C'est une histoire d'auto-hébergement, point final.

• Aucune donnée d'utilisation — zéro téléchargement le premier jour signifie aucun retour de la communauté, aucun fine-tuning, aucun « Je l'ai exécuté sur X et ça a planté à Y. » Les premiers retours du monde réel sont encore à venir.

• Une fonctionnalité expérimentale — la sortie d'annotation de mise en page est signalée par Liquid lui-même comme « expérimentale » et « peut changer, peut être peu fiable et peut ne pas être triviale à analyser ». Ne construisez pas encore votre analyseur autour de celle-ci.

• Faible couverture tierce — la presse de la première semaine se résume surtout à de courts tours d'horizon. Personne n'a mené de test indépendant approfondi.

Screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B, showing Image-Text-to-Text, license lfm1.0, 16 languages, 'This model isn't deployed by any Inference Provider', and 228 tok/s on Apple M5 Max / 116 tok/s on AMD Ryzen AI Max+ 395 in under 3.3 GB of memory.

Rien de tout cela ne signifie que le modèle est mauvais. Cela signifie qu'il n'a pas encore fait ses preuves, comme tout modèle dans les jours qui suivent sa sortie.

Comment l'exécuter vous-même

Pour un modèle aussi jeune, l'écosystème qui l'entoure est remarquablement bon. Les variantes de format sont arrivées le jour même de la publication des poids : GGUF pour llama.cpp, ONNX, et cinq quantifications MLX pour Apple Silicon, aux côtés du checkpoint natif bf16 pour Transformers, vLLM, et SGLang. Liquid annonce une prise en charge dès le premier jour pour llama.cpp, MLX, vLLM, SGLang, et ONNX, ainsi qu'une démo navigateur WebGPU. Les paramètres d'échantillonnage recommandés sont une température de 0,2, un top_k de 50, une pénalité de répétition de 1,0, et la vision est gérée par la configuration du processeur du modèle. Si vous voulez l'essayer sur un ordinateur portable ce soir, les versions MLX ou GGUF sont la voie la plus rapide.

Que regarder

Deux choses déterminent si LFM2.5-VL-3B compte vraiment au-delà du cycle de battage médiatique. Premièrement, si les chiffres de grounding et de compréhension d'écran survivent à une reproduction indépendante — 80,7 sur ScreenSpot-v2 et 87,9 sur RefCOCO sont les deux affirmations qui méritent le plus d'être vérifiées, car ce sont celles qui feraient de ce modèle un modèle edge véritablement disruptif. Deuxièmement, si un endpoint hébergé apparaît, car cela change la donne : on passe d'un « projet intéressant à auto-héberger » à « déployable dès aujourd'hui ». Et c'est précisément là qu'une couche de routage montre sa valeur : une seule API sur plus de 200 modèles signifie que le jour où Liquid ou un fournisseur met en place un endpoint, vous ajoutez LFM2.5-VL-3B à côté des modèles que vous appelez déjà sans modifier votre intégration, au prix catalogue du fournisseur avec zéro marge, et la bascule automatique vous permet d'y diriger du trafic réel pendant qu'un modèle éprouvé couvre les appels qu'il rate. Jusque-là, c'est une histoire d'auto-hébergement prometteuse — et pour un modèle d'une semaine, c'est déjà plus que ce que la plupart des modèles publiés obtiennent.

Screenshot of Liquid AI's announcement blog post 'LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge' dated Aug 12, 2026, showing the opening paragraphs and an evaluations table comparing LFM2.5-VL-3B with Gemma, InternVL, and Qwen models.
© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube