
LFM2.5-VL-3B: Mô Hình Ngôn Ngữ Thị Giác 3B Mới của Liquid AI Dành Cho Edge
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
Điều đầu tiên cần biết về LFM2.5-VL-3B là mô hình này được phát hành theo hai bước nửa chừng. Các trọng số xuất hiện trên Hugging Face vào ngày 11 tháng 8 năm 2026 — một checkpoint bf16 đầy đủ, một model card kèm bảng benchmark và README bằng mười sáu ngôn ngữ, và không kèm bất kỳ thông báo nào. Model card hiển thị số lượt tải về bằng không. Ngày hôm sau, 12 tháng 8, Liquid AI đăng bài viết chính thức, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge," và bản phát hành thầm lặng trở thành một bản phát hành thực sự. Nếu bạn đang đọc bài viết này trong cùng tuần, bạn đang đọc một trong những bài đánh giá độc lập sớm nhất về một mô hình mà gần như chưa ai bên ngoài phòng thí nghiệm của Liquid từng chạy thử — nên đây là những gì thực sự có thể biết được từ kho lưu trữ, và những gì không thể biết được.
LFM2.5-VL-3B là gì
LFM2.5-VL-3B là mô hình thị giác–ngôn ngữ — đầu vào là hình ảnh và văn bản, đầu ra là văn bản — được xây dựng trên backbone văn bản LFM2.5 của Liquid AI. Cụ thể: mô hình ngôn ngữ là LFM2.5-2.6B, kết hợp với bộ mã hóa thị giác SigLIP2 NaFlex 400M, đạt tổng cộng khoảng 3,1 tỷ tham số. Mô hình giữ nguyên kiến trúc lai đặc trưng của dòng sản phẩm gồm các khối tích chập có cổng tầm ngắn đan xen với cơ chế chú ý truy vấn nhóm (grouped-query attention), từ vựng 128.000 token và cửa sổ ngữ cảnh 32.768 token. Mô hình hỗ trợ 16 ngôn ngữ (tiếng Anh, tiếng Ả Rập, tiếng Trung, tiếng Pháp, tiếng Đức, tiếng Hindi, tiếng Indonesia, tiếng Ý, tiếng Nhật, tiếng Hàn, tiếng Ba Lan, tiếng Bồ Đào Nha, tiếng Nga, tiếng Tây Ban Nha, tiếng Thái, tiếng Việt), được phát hành dưới dạng bfloat16 và được cấp phép theo giấy phép mã nguồn mở lfm1.0 của Liquid.
Đây không phải là mô hình xây dựng từ đầu. Thẻ mô tả đây là một biến thể đa phương thức của LFM2.5, được phát triển dựa trên LFM2-VL-3B trước đó với các bước huấn luyện bổ sung ở giai đoạn giữa và sau. Dòng phát triển này rất quan trọng: các kỹ năng thị giác được xếp lớp trên một mô hình ngôn ngữ vốn đã được tiền huấn luyện trên khoảng 34 nghìn tỷ token, vì vậy phần ngôn ngữ không phải là thứ tầm thường — nó là cùng một engine dòng họ mà các mô hình văn bản sử dụng, với một bộ mã hóa thị giác được gắn thêm vào và huấn luyện lại cho các tác vụ thị giác.
Những gì nó có thể làm
Bài viết của Liquid nêu ra bốn cải tiến so với LFM2-VL-3B trước đó: hiểu màn hình và giao diện người dùng, gọi hàm, định vị, và đầu vào đa hình ảnh. Nói một cách đơn giản, điều đó có nghĩa là:
• Grounding — chỉ vào các đối tượng bằng truy vấn ngôn ngữ tự nhiên ("biển báo dừng," "cột giá") và nhận lại một vị trí đã chuẩn hóa.
• Hiểu màn hình — trả lời các câu hỏi về nội dung trên màn hình và vị trí của chúng, được đánh giá chuẩn trên ScreenSpot-v2.
• OCR với chú thích bố cục — OCR toàn trang cũng trả về cấu trúc tài liệu, với 23 nhãn bố cục (văn bản, tiêu đề, danh sách, bảng, chú thích bảng, biểu đồ, phương trình, mã, đầu trang và chân trang, và hơn thế nữa) dưới dạng tọa độ số nguyên được chuẩn hóa.
Sử dụng công cụ — một quy trình gọi hàm gồm bốn bước, nhận định nghĩa công cụ dưới dạng JSON, phát ra các lệnh gọi kiểu Python giữa các token gọi công cụ và trả về câu trả lời dạng văn bản thuần cuối cùng.
• Đầu vào đa hình ảnh — suy luận dựa trên nhiều hình ảnh trong một lượt.
{{1}}Hướng dẫn của Liquid về những trường hợp không phù hợp lại đặc biệt cụ thể.{{/1}} Thẻ gợi ý sử dụng cho {{2}}các tác vụ một lượt, thông lượng cao, độ trễ thấp{{/2}} — {{3}}phát hiện vật thể gần thời gian thực trong ô tô, OCR hàng loạt tài liệu quét, dịch thực đơn và biển báo giao thông trên thiết bị{{/3}} — và cảnh báo rõ ràng về {{4}}các công việc suy luận nặng với ngữ cảnh dài, thiết kế web trực quan, và các câu hỏi kỹ thuật cao về bản vẽ.{{/4}}
Các số liệu — tất cả do nhà cung cấp báo cáo
Mọi con số trong phần này đều đến từ thẻ mô hình và bài đăng blog của chính Liquid AI. Không có con số nào trong số đó được tái lập một cách độc lập, và cho đến khi bên thứ ba chạy điểm kiểm tra, bạn nên coi đây là những tuyên bố, không phải sự thật. Nhãn đó đang thực sự có tác dụng ở đây, vì về mặt lý thuyết, thành tích này thực sự ấn tượng:
• Grounding — RefCOCO macro precision@1 đạt 87,9, tăng từ 57,1 trên LFM2-VL-3B trước đó — mức tăng khoảng ba mươi điểm mà Liquid cho là nhờ vào hậu huấn luyện thị giác.
• Hiểu màn hình — trung bình ScreenSpot-v2 là 80,7, mà Liquid báo cáo là cao hơn mức 78,5 mà họ gán cho Qwen3.5-4B.
• Sử dụng công cụ — ToolSandbox 59.5, cao hơn gấp đôi mức 26.4 của Liquid đo trên LFM2-VL-3B; BFCLv4 32.5, tăng từ 20.5.
• Lập luận thị giác tổng quát — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.
• OCR — OCRBenchv2 (tập con tiếng Anh) 47.5, tăng từ 43.9.
• Suy luận đa phương thức khó — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — điểm yếu hơn, như dự kiến đối với một mô hình 3B.
• Tốc độ, do nhà cung cấp vận hành — 228 token/giây trên Apple M5 Max, 116 token/giây trên AMD Ryzen AI Max+ 395 và 20 token/giây trên Galaxy S26 Ultra, tất cả trong khoảng 3,3 GB bộ nhớ. Trên H100 với vLLM, Liquid tuyên bố khoảng 11K token đầu ra/giây ở độ đồng thời cao và thời gian đến token đầu tiên khoảng 34 ms trên một clip năm khung hình, điều mà họ lý giải là do mô hình trả lời trực tiếp thay vì suy luận.

Đó là quá nhiều lời khẳng định cho một mô hình 3B, và cần nhắc lại lời cảnh báo ở chân trang của chính thẻ mô hình: đây là những con số của Liquid. Khoảng cách giữa "đạt điểm cao trong bài đánh giá phòng thí nghiệm" và "trụ vững trên dữ liệu của bạn" chính là nơi một mô hình mới như thế này thường bị vấp ngã.
Điều gì vẫn chưa được biết đến
Danh sách trung thực những câu hỏi mở:
• Không có điểm chuẩn độc lập — tính đến thời điểm viết bài này, LFM2.5-VL-3B chưa xuất hiện trên bảng xếp hạng của bên thứ ba nào. Mọi điểm số ở trên đều do nhà cung cấp báo cáo.
Không có endpoint được lưu trữ — chưa có nhà cung cấp inference nào phục vụ nó. Đây là câu chuyện tự lưu trữ, chấm hết.
• Không có dữ liệu sử dụng — không có lượt tải xuống nào trong ngày đầu tiên nghĩa là không có phản hồi từ cộng đồng, không có bản tinh chỉnh, không có câu "Tôi đã chạy nó trên X và nó hỏng ở Y." Những báo cáo thực tế đầu tiên vẫn còn ở phía trước chúng ta.
• Một tính năng thử nghiệm — đầu ra chú thích bố cục được chính Liquid đánh dấu là "thử nghiệm" và "có thể thay đổi, có thể không đáng tin cậy, và có thể không dễ phân tích cú pháp." Đừng xây dựng trình phân tích cú pháp của bạn dựa trên nó ngay.
• Độ phủ sóng từ bên thứ ba còn mỏng — báo chí tuần đầu chủ yếu là các bản tin tổng hợp ngắn. Chưa ai thực hiện một bài kiểm tra độc lập chuyên sâu.

Điều đó không có nghĩa là mô hình kém. Nó có nghĩa là mô hình chưa được kiểm chứng, theo cách mà bất kỳ mô hình nào cũng chưa được kiểm chứng trong những ngày đầu sau khi phát hành.
Cách tự chạy nó
Với một mô hình còn non trẻ như vậy, câu chuyện hệ sinh thái lại tốt một cách lạ thường. Các biến thể định dạng ra mắt cùng ngày với bộ trọng số: GGUF cho llama.cpp, ONNX và năm bản lượng tử hóa MLX cho Apple Silicon, cùng với checkpoint bf16 gốc cho Transformers, vLLM và SGLang. Liquid liệt kê hỗ trợ ngay ngày đầu ra mắt trên llama.cpp, MLX, vLLM, SGLang và ONNX, kèm theo bản demo trình duyệt WebGPU. Các tham số lấy mẫu được khuyến nghị là temperature 0.2, top_k 50, repetition penalty 1.0, với phần thị giác được xử lý bởi cấu hình processor của mô hình. Nếu bạn muốn dùng thử trên laptop ngay tối nay, các bản build MLX hoặc GGUF là con đường ngắn nhất.
Xem gì
{{1}}Hai điều quyết định liệu LFM2.5-VL-3B có thực sự quan trọng vượt ra ngoài chu kỳ cường điệu hay không.{{/1}} {{2}}Thứ nhất, liệu các số liệu về grounding và khả năng hiểu màn hình có trụ vững trước sự tái lập độc lập hay không — 80.7 trên ScreenSpot-v2 và 87.9 trên RefCOCO là hai tuyên bố đáng kiểm chứng nhất, vì đó là những con số có thể biến đây thành một mô hình edge thực sự mang tính đột phá.{{/2}} {{3}}Thứ hai, liệu một hosted endpoint có xuất hiện hay không, vì điều đó thay đổi cách đánh giá từ "dự án tự lưu trữ thú vị" thành "triển khai được ngay hôm nay".{{/3}} {{4}}Và đó chính là lúc một tầng định tuyến chứng tỏ giá trị của mình: một API trên 200+ mô hình nghĩa là vào ngày Liquid hoặc một nhà cung cấp triển khai endpoint, bạn chỉ cần thêm LFM2.5-VL-3B vào bên cạnh những mô hình bạn đã gọi mà không cần thay đổi tích hợp của mình, với giá niêm yết của nhà cung cấp và không phụ phí, đồng thời tính năng tự động chuyển đổi dự phòng cho phép bạn hướng lưu lượng thực vào nó trong khi một mô hình đã được kiểm chứng sẽ đảm nhận những lệnh gọi mà nó xử lý không tốt.{{/4}} {{5}}Cho đến lúc đó, đó vẫn là một câu chuyện tự lưu trữ đầy hứa hẹn — và với một mô hình mới chỉ một tuần tuổi, như vậy đã là nhiều hơn những gì hầu hết các bản phát hành nhận được.{{/5}}

