
LFM2.5-VL-3B:Liquid AI 面向边缘的全新 3B 视觉语言模型
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
关于LFM2.5-VL-3B,首先要知道的是,它是分两步半正式发布的。权重于2026年8月11日出现在Hugging Face上——一个完整的bf16检查点、一张带有基准测试表的模型卡片和一份十六种语言的README,并且没有附带任何公告。该卡片显示下载量为零。第二天,也就是8月12日,Liquid AI发布了官方文章《LFM2.5-VL-3B:一款更好、更快的边缘端视觉语言模型》,这次低调的发布才真正成为一次正式发布。如果你是在同一周读到这篇文章,那么你正在阅读的是关于该模型最早期的独立评测之一,而目前除了Liquid实验室内部,几乎还没有人运行过这个模型——因此,以下内容是从代码仓库中实际可知的信息,以及尚不可知的信息。
LFM2.5-VL-3B 是什么?
LFM2.5-VL-3B 是一个视觉-语言模型——输入图像和文本,输出文本——基于 Liquid AI 的 LFM2.5 文本骨干构建。具体来说:语言模型为 LFM2.5-2.6B,搭配 SigLIP2 NaFlex 400M 视觉编码器,总参数约 31 亿。它保留了该系列中短程门控卷积块与分组查询注意力交织的混合架构,拥有 128,000 词元的词表以及 32,768 词元的上下文窗口。它支持十六种语言(英语、阿拉伯语、中文、法语、德语、印地语、印度尼西亚语、意大利语、日语、韩语、波兰语、葡萄牙语、俄语、西班牙语、泰语、越南语),以 bfloat16 格式发布,并采用 Liquid 的 lfm1.0 开放许可证授权。
这不是一个从头开始训练的模型。模型卡片将其描述为LFM2.5的多模态变体,该变体基于早期的LFM2-VL-3B构建,并进一步进行了中期和后期训练。这一血统很重要:视觉能力是叠加在一个已经在大约34万亿个token上预训练过的文本模型之上的,因此语言端不是玩具——它与文本模型使用的是同一个家族引擎,只是焊接了一个视觉编码器,并针对视觉任务进行了重新训练。
它能做什么
Liquid 的文章指出了相较于之前的 LFM2-VL-3B 的四项改进:屏幕与 UI 理解、函数调用、grounding 以及多图像输入。简单来说,就是:
• 指代定位 — 通过自然语言查询(如“停车标志”、“价格列”)指向对象,并返回归一化位置。
• {{1}}屏幕理解{{/1}}——回答关于屏幕上内容和位置的问题,在 ScreenSpot-v2 上进行基准测试。
• 带布局标注的OCR — 全页OCR,同时返回文档结构,包含23种布局标签(文本、标题、列表、表格、表格标题、图表、公式、代码、页眉和页脚等),以归一化整数坐标表示。
• 工具使用——一个四步函数调用流程,将工具定义作为JSON接收,在工具调用标记之间生成Python风格的调用,并返回最终的纯文本答案。
• 多图像输入 — 在单次对话中跨多张图像进行推理。
Liquid 自身关于其不适配场景的指导异常具体。该卡片推荐将其用于单轮、高吞吐、低延迟任务——汽车领域的近实时目标检测、扫描文档的批量 OCR、设备端菜单与路标翻译——并明确警告其不适合长上下文推理密集型工作、视觉网页设计以及高度专业的蓝图问题。
这些数字——均为供应商报告的
本节中的每个数字均来自 Liquid AI 自己的模型卡和博客文章。其中没有任何内容被独立复现,在第三方运行该检查点之前,您应将这些内容视为声明而非事实。这个标签在这里起着实际作用,因为纸面上的记录确实相当出色:
• 视觉定位 — RefCOCO macro precision@1 为 87.9,较之前 LFM2-VL-3B 的 57.1 有所提高 —— 约三十个百分点的飞跃,Liquid 将其归功于视觉后训练。
• 屏幕理解——ScreenSpot-v2 平均分为 80.7,Liquid 报告称该分数领先于他们归因于 Qwen3.5-4B 的 78.5。
• 工具使用 — ToolSandbox 59.5,是 LFM2-VL-3B 上 Liquid 测得的 26.4 的两倍多;BFCLv4 32.5,较 20.5 有所上升。
• 通用视觉推理 — MME 73.1、MMStar 63.3、RealWorldQA 73.1、MMMB 83.0、ChartQA 81.3、MathVista 68.5、POPE 88.7。
• OCR — OCRBenchv2(英文子集)47.5,较43.9有所提升。
• 硬多模态推理 — MMMU Pro 30.5、BLINK 61.5、MuirBench 58.3 — 较弱的方面,对于3B模型来说符合预期。
• 速度(厂商运行)——在 Apple M5 Max 上为 228 tokens/s,在 AMD Ryzen AI Max+ 395 上为 116 tokens/s,在 Galaxy S26 Ultra 上为 20 tokens/s,且均在大约 3.3 GB 内存内。在配备 vLLM 的 H100 上,Liquid 声称在高并发下输出约 11K tokens/s,五帧片段的首令牌时间约为 34 ms,它将其归因于模型直接作答而不是进行推理。

对于一个 3B 模型来说,这些说法确实不少,而且值得重申模型自家卡片页脚中的告诫:这些是 Liquid 的数据。“在实验室评估中表现良好”和“在你的数据上经得起考验”之间的差距,恰恰是这样一个新模型通常容易栽跟头的地方。
尚未知晓的部分
未解决问题的坦诚清单:
• 无独立基准测试——截至撰写本文时,LFM2.5-VL-3B 未出现在任何第三方排行榜上。上述所有分数均为供应商自行报告。
• 没有托管端点——目前还没有推理服务提供商提供它。这是一个自托管的故事,仅此而已。
• 没有使用数据——首日零下载意味着没有社区反馈、没有微调,也没有“我在X上运行它,结果在Y处出错了”这样的报告。首批真实使用报告仍未到来。
• 一个实验性功能——布局注释输出被 Liquid 自身标记为“实验性”和“可能会变化、可能不可靠,并且可能不易解析。”暂时不要围绕它构建你的解析器。
• 第三方报道稀少 — 第一周的媒体报道大多是简短的新闻汇总。还没有人进行过深入的独立测试。

这并不意味着模型不好。它只是意味着它尚未得到验证,就像任何模型在发布后的日子里都尚未得到验证一样。
如何自行运行
对于一个如此年轻的模型来说,其生态系统表现异常出色。格式变体与权重同日发布:llama.cpp 的 GGUF、ONNX,以及适用于 Apple Silicon 的五个 MLX 量化版本,同时还有面向 Transformers、vLLM 和 SGLang 的原生 bf16 检查点。Liquid 列出了 llama.cpp、MLX、vLLM、SGLang 和 ONNX 的首日支持,外加一个 WebGPU 浏览器演示。推荐的采样参数为 temperature 0.2、top_k 50、repetition penalty 1.0,视觉部分由模型的 processor 配置处理。如果你想今晚就在笔记本电脑上试用,MLX 或 GGUF 版本是最快捷的途径。
看什么
有两件事决定了LFM2.5-VL-3B能否在炒作周期之外真正产生影响。首先,其接地能力和屏幕理解分数能否经得起独立复现——ScreenSpot-v2上的80.7和RefCOCO上的87.9是最值得验证的两项数据,因为正是这些数字会让它成为真正具有颠覆性的边缘模型。其次,是否会出现托管端点,因为这会将其定位从“有趣的自托管项目”转变为“今天即可交付”。而正是在这个时候,路由层才体现出其价值:一个API对接200多个模型,意味着当Liquid或某家提供商上线端点的那一天,你可以把LFM2.5-VL-3B添加到你已经在调用的模型旁边,无需改动集成,按提供商的标价且零加价,自动故障转移还能让你把真实流量指向它,同时由经过验证的模型来处理它出错的调用。在那之前,它只是一个有前景的自托管故事——而对于一个发布仅一周的模型来说,这已经比大多数模型发布时得到的关注更多了。

