
Liquid AI d1-omni-600M so với LFM2.5-VL-3B: Một bên quyết định, một bên mô tả
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Liquid AI d1-omni-600M và LFM2.5-VL-3B đều nhỏ, đều đa phương thức, đều được cùng một phòng thí nghiệm công bố trên Hugging Face dưới cùng giấy phép lfm1.0 — và việc ghép chúng lại là một sai lầm về thể loại hóa ra lại hữu ích. LFM2.5-VL-3B ra mắt vào ngày 12 tháng 8 năm 2026 với tư cách là mô hình ngôn ngữ-thị giác biên của Liquid AI: 3,1 tỷ tham số, cửa sổ 32.768 token, và đầu ra là văn xuôi. Đưa cho nó một trang đã quét và nó trả về bản chép lại, kèm bố cục, dưới dạng văn bản. Liquid AI d1-omni-600M được tải lên vào ngày 7 tháng 10 năm 2026 cùng với phần còn lại của dòng d1 mở, và nó làm điều ngược lại với cùng đầu vào. Nó là một mô hình quyết định 587 triệu tham số: bạn gắn các câu hỏi có tên vào một trạng thái và nó báo cáo những gì nó đã tin — P(có), một nhãn được chọn kèm độ tin cậy, một vị trí trên thang điểm từ hai đến mười có thứ tự — trong một lượt truyền xuôi duy nhất, với không token đầu ra và không có gì ở hạ nguồn để phân tích. Nếu bạn đã tìm kiếm "mô hình Liquid đa phương thức nhỏ," thì hiện tại có hai hình dạng trước mắt bạn, và hình dạng chính là quyết định.
Trang này là những gì mà hai thẻ mô hình, bài đăng phát hành ngày 13 tháng 10 và chính các kho lưu trữ thực sự là. Nó cũng nói rõ chúng dừng lại ở đâu. Không có nội dung nào trong so sánh này được tái tạo bên ngoài Liquid AI, và với một trong hai mô hình, nhà cung cấp hoàn toàn không công bố bất kỳ benchmark độ chính xác nào dành riêng cho năng lực của chính mô hình đó.
Hai trạm kiểm soát, nằm cạnh nhau
Các bảng thông số kỹ thuật khác biệt trên gần như mọi khía cạnh, đúng như điều bạn sẽ kỳ vọng ở hai mẫu vốn không được thiết kế để cạnh tranh cho cùng một vị trí.
• Nó là gì — LFM2.5-VL-3B là một mô hình ngôn ngữ-thị giác tạo sinh có khả năng viết văn bản; Liquid AI d1-omni-600M là một mô hình quyết định trả về câu trả lời có cấu trúc và không phát ra token nào
• Tham số — 3,1B ở BF16 cho LFM2.5-VL-3B so với 587M cho Liquid AI d1-omni-600M, bản thân nó là một trunk chia sẻ và đầu quyết định 381M, cộng với một bộ mã hóa thị giác 94M và một bộ mã hóa âm thanh 112M
• Backbone — LFM2.5-VL-3B ghép một mô hình ngôn ngữ LFM2.5-2.6B với bộ mã hóa thị giác 400M SigLIP2 NaFlex được tối ưu hóa theo hình dạng; Liquid AI d1-omni-600M được huấn luyện từ LFM2.5-Encoder-350M, một bộ mã hóa hai chiều, với một tháp SigLIP2 lấy từ LFM2.5-VL-450M và một FastConformer 17 lớp cho âm thanh
• Đầu vào — văn bản và hình ảnh cho LFM2.5-VL-3B; văn bản cùng hình ảnh hoặc văn bản cùng tối đa 30 giây âm thanh cho Liquid AI d1-omni-600M, sẽ báo lỗi ValueError nếu hình ảnh và âm thanh đến trong cùng một yêu cầu
• Ngữ cảnh — 32,768 token cho LFM2.5-VL-3B so với 16,384 vị trí văn bản, hình ảnh và âm thanh kết hợp cho Liquid AI d1-omni-600M, mà thẻ của nó cho biết thêm rằng khi có hình ảnh, văn bản trạng thái và câu hỏi được rút gọn còn 896 token để khớp với huấn luyện
• Từ vựng — 128.000 token cho LFM2.5-VL-3B, 65.536 cho Liquid AI d1-omni-600M
• Runtime — LFM2.5-VL-3B chạy trong transformers và vLLM, đồng thời có một mô hình nháp DSpark riêng cho giải mã suy đoán; Liquid AI d1-omni-600M đi kèm mã tùy chỉnh, cần trust_remote_code=True, và thẻ của nó khuyến nghị dùng float16 trên GPU, đồng thời cảnh báo rằng bfloat16 đã làm thay đổi câu trả lời hàng đầu ở một số hàng
• Giấy phép — lfm1.0 cho cả hai, cho phép tinh chỉnh và triển khai
Một dòng trong danh sách đó đang làm nhiều việc hơn tất cả những dòng còn lại. Liquid AI d1-omni-600M được xây dựng trên một bộ mã hóa hai chiều chứ không phải bộ giải mã. Đó không phải là một bản thu gọn kích thước của LFM2.5-VL-3B; đó là một nguồn gốc khác, và đó là lý do mang tính kiến trúc khiến hai mô hình không thể hoán đổi cho nhau, bất kể các bảng benchmark được đọc theo cách nào.
Hợp đồng đầu ra quyết định nhiều hơn so với các benchmark
Hãy hỏi LFM2.5-VL-3B một câu hỏi về một hình ảnh và bạn sẽ nhận được ngôn ngữ trả về. Điều đó đáng tiền khi câu trả lời phải được một người đọc, được ghi log dưới dạng chuỗi, hoặc được đưa vào một bước vốn mong đợi văn xuôi. Đó cũng là một rủi ro mà bạn phải xử lý bằng kỹ thuật: đầu ra được sinh có thể đi lan man, một yêu cầu có dạng JSON có thể trả về với hình dạng khác với thứ bạn yêu cầu, và mỗi token đều bị tính phí và phải chờ. Mô hình được xác định phạm vi rõ ràng cho công việc thị giác một lượt, thông lượng cao, độ trễ thấp — OCR theo lô tài liệu quét, phát hiện thời gian thực trong xe, dịch biển báo trên thiết bị — và được định hướng rõ ràng để tránh xa các câu hỏi ngữ cảnh dài, nặng về suy luận như "có gì sai với bản thiết kế này."
Liquid AI d1-omni-600M trả lời một câu hỏi hẹp hơn hẳn trong một khuôn khổ đáng tin cậy hơn hẳn. Giao diện của nó là một trạng thái — văn bản, JSON, một hoặc nhiều hình ảnh, hoặc tối đa 30 giây giọng nói — cộng với một tập các câu hỏi có tên, mỗi câu hỏi tự khai báo kiểu của riêng nó. noul là câu hỏi có/không và trả về P(yes) nằm trong khoảng từ 0 đến 1. choice chọn một nhãn từ tập hợp do bạn đặt tên và trả về nhãn đó, một độ tin cậy, và xác suất của từng phương án. score đặt trạng thái lên một thang có thứ tự từ hai đến mười mức và trả về mức kỳ vọng cùng với phân phối của nó. Nhiều câu hỏi có thể cùng gắn vào một trạng thái và được đọc chỉ trong một lượt chạy duy nhất, vì vậy bộ đếm sử dụng trong model card báo cáo output_tokens: 0. Không có bước sinh văn bản, nghĩa là không tồn tại thứ gọi là đầu ra không phân tích cú pháp được.
Điều bạn đánh đổi là mọi thứ mà một câu trả lời được tạo ra mang theo mà một nhãn không có: lập luận, lời rào đón, câu bạn có thể dán vào một ticket, khả năng hỏi tiếp trong cùng một cuộc trò chuyện. Liquid nói thẳng điều đó — mô hình này không phải mô hình trò chuyện và không viết văn bản. Nếu pipeline của bạn cần một lời giải thích bên cạnh kết luận, thì Liquid AI d1-omni-600M là nửa không phù hợp của cặp, và câu trả lời trung thực là chạy cả hai: LFM2.5-VL-3B để tạo ra phần đọc hình ảnh, Liquid AI d1-omni-600M để tạo ra quyết định về hình ảnh đó.

Không có số liệu tầm nhìn đối đầu trực tiếp, và đó chính là phát hiện.
Bước tiếp theo theo bản năng là đối chiếu các benchmark thị giác. Bạn không thể. Với LFM2.5-VL-3B, nhà cung cấp công bố một bộ đầy đủ — RefCOCO Macro Precision@1 ở mức 87,9, ScreenSpot-v2 ở mức 80,7, ChartQA ở mức 81,3, POPE ở mức 88,7, MMStar ở mức 63,3, BLINK ở mức 61,5, MuirBench ở mức 58,3, ToolSandBox ở mức 59,5, OCRBench v2 tiếng Anh ở mức 47,5, và RealWorldQA ở mức 73,1, nhỉnh hơn mức 71,1 của LFM2-VL-3B trước đó. Tất cả những con số đó đều do nhà cung cấp báo cáo, chưa có con số nào được chạy lại một cách độc lập, và dù vậy chúng vẫn là những tuyên bố cụ thể về những năng lực cụ thể mà người đọc có thể buộc phòng thí nghiệm phải chịu trách nhiệm.
Đối với Liquid AI d1-omni-600M, bài đăng phát hành cho biết Decision Index v0.3 bao gồm một phân chia thị giác riêng tư “mà chúng tôi không báo cáo trong bản phát hành này”, và rằng thay vào đó, Liquid đã xác thực rằng checkpoint 600M “xử lý được cả ba phương thức”, với bằng chứng được đưa vào các bản demo playground. Đó là toàn bộ hồ sơ thị giác đã được công bố. Không có con số benchmark hình ảnh nào cho checkpoint này, dù trong model card hay bài đăng ra mắt của nó. Cùng bài đăng đó còn xác nhận điều còn thiếu ở phía âm thanh một cách trực tiếp hơn: các benchmark quyết định âm thanh chuyên dụng, theo đúng lời của nhà cung cấp, “hiện là một vấn đề mở.”
Vậy cách diễn giải đúng về cuộc đối đầu này là bất đối xứng và nên được nói rõ như vậy. LFM2.5-VL-3B đã chứng minh năng lực thị giác cùng với các con số đi kèm. Liquid AI d1-omni-600M có một bộ mã hóa thị giác vay mượn từ một mô hình anh em, một adapter được huấn luyện dựa trên một backbone đóng băng, một bản demo và một lời hứa. Nếu triển khai của bạn cần mô hình đúng về hình ảnh trong tháng này, thì 3B là mô hình duy nhất trong hai mô hình có bất cứ thứ gì để đứng vững.
Tốc độ: chỉ một trong số này đã được đo
Vì một mô hình quyết định không tạo ra gì cả, độ trễ mới là con số quan trọng, và một lần nữa, chỉ một phía được tài liệu hóa. LFM2.5-VL-3B được công bố ở mức 228 token/giây trên Apple M5 Max và 116 token/giây trên AMD Ryzen AI Max+ 395, cả hai đều nằm trong 3,3 GB bộ nhớ, với khoảng 20 token/giây trên Galaxy S26 Ultra và khoảng 11.000 token/giây trên một H100 duy nhất dưới vLLM. Những con số đó mô tả thông lượng giải mã, vốn là phép đo phù hợp cho một mô hình có khả năng viết.
Đối với Liquid AI d1-omni-600M, thẻ nêu rõ rằng các số liệu suy luận không được báo cáo vì mô hình là bản phát hành nghiên cứu sớm và đang được phát triển tích cực. Mô hình anh em d1-3B trong cùng dòng thì có bảng độ trễ — 8 ms cho một câu hỏi trên RTX 4090, 16 ms trên Jetson AGX Thor, 26 ms trên Jetson AGX Orin 64 GB, 50 ms trên Orin Nano, với ba câu hỏi trên một trạng thái tốn khoảng 1,3 lần thời gian của một câu. Những con số đó thuộc về mô hình quyết định 3B và không được suy rộng sang 600M. Đối với Liquid AI d1-omni-600M, quan điểm trung thực là kiến trúc hàm ý một mô hình nhỏ, nhanh và chưa có ai ngoài phòng thí nghiệm công bố một con số mili giây nào.
Dấu chân trọng số ít nhất có thể được ước tính. Ở độ chính xác float16 mà thẻ đề xuất, 587M tham số tương đương khoảng 1,2 GB trọng số trước khi tính đến activations — phép tính trên số tham số đã công bố, không phải phép đo từ nhà cung cấp — so với mức dưới 3,3 GB mà Liquid báo cáo cho LFM2.5-VL-3B. Trên một thiết bị nơi megabyte là ràng buộc, sự khác biệt đó chính là lý lẽ dành cho mô hình 600M.

Làm thế nào để chọn giữa chúng
Lựa chọn được giải quyết dứt khoát một khi hợp đồng đầu ra được coi là cố định thay vì có thể thương lượng.
Hãy dùng LFM2.5-VL-3B khi đầu ra là văn bản: OCR toàn trang kèm chú thích bố cục, grounding và phát hiện từ các truy vấn ngôn ngữ tự nhiên, dịch biển báo ngay trên thiết bị, bất kỳ bước nào mà con người hoặc một mô hình ngôn ngữ hạ nguồn tiêu thụ câu trả lời. Nó cũng có ngữ cảnh rộng hơn ở 32.768 token và độ phủ ngôn ngữ sâu hơn trên thực tế, vì câu trả lời của nó là ngôn ngữ chứ không phải nhãn.
Hãy dùng Liquid AI d1-omni-600M khi đầu ra cần có là một quyết định: định tuyến một ticket, phân loại một ca sàng lọc, kiểm duyệt một clip, gác cổng cho một rào chắn an toàn, chấm điểm một phản hồi trên thang từ hai đến mười — và, điểm độc nhất giữa hai mô hình này, khi đầu vào là giọng nói. Nó là mô hình duy nhất trong cặp có thể nhận âm thanh, tối đa 30 giây mỗi yêu cầu, mặc dù thẻ mô hình của nó lưu ý rằng âm thanh được huấn luyện trên các cuộc trao đổi giữa một người nói tiếng Anh và một trợ lý, một mô tả hẹp về thế giới mà các lệnh gọi của bạn sẽ đến từ đó.
Đừng chọn cả hai, mà hãy dùng một mô hình ngôn ngữ-thị giác tổng quát, nếu tác vụ cần suy luận về hình ảnh thay vì chỉ đọc hay đưa ra phán quyết về nó. Cả hai thẻ mô hình đều hướng ra khỏi trường hợp sử dụng đó, và Liquid AI d1-omni-600M không có cơ chế nào để thử làm điều đó.
Đang thử một checkpoint thử nghiệm mà không đặt cược cả pipeline vào nó
Liquid AI d1-omni-600M, theo chính nhãn của nhà cung cấp, là một bản phát hành nghiên cứu sớm và hành vi thị giác lẫn âm thanh của nó chưa được đánh giá chuẩn. Đó chính xác là hồ sơ của một mô hình bạn muốn đánh giá phía sau một phương án dự phòng thay vì đặt trước mặt khách hàng. OrcaRouter định tuyến hơn 200 mô hình qua một khóa API với tự động chuyển đổi dự phòng giữa các nhà cung cấp, đây là cách rẻ để đưa một checkpoint như thế này lên một luồng trực tiếp: nếu tuyến thử nghiệm suy giảm hoặc một nhà cung cấp gặp sự cố, yêu cầu sẽ rơi vào phương án dự phòng mà không cần thay đổi mã. Cùng một khóa mang mọi mô hình mà pipeline chuyển giao, ở mức giá niêm yết của từng nhà cung cấp được chuyển nguyên với 0% markup, nên việc nhà cung cấp giảm giá cũng thành giá của bạn ngay trong cùng ngày.
Một lưu ý, được nêu ra vì nó mang tính quyết định: các mô hình d1 mở và dòng LFM2.5-VL hiện chưa có trong danh mục của chúng tôi. Tự lưu trữ trọng số là cách mà nhà cung cấp khuyến nghị cho cả hai, với hỗ trợ llama.cpp ngay từ ngày đầu trên phần cứng Apple, AMD, Qualcomm và NVIDIA, còn chạy chúng trên một endpoint được lưu trữ đồng nghĩa với việc dùng API của chính nhà cung cấp hoặc các nền tảng bên thứ ba. Coi trang này là một tuyên bố về tính khả dụng sẽ là một sai lầm.

Xem gì
Câu hỏi thú vị không phải là liệu 600M cuối cùng có vượt được 3B ở bất cứ điều gì không — nó sẽ không, và nó vốn không được xây dựng để làm điều đó. Mà là liệu Liquid AI có công bố phần tách thị giác riêng tư mà họ đã giữ lại hay không, và liệu có ai xây dựng được chuẩn đánh giá quyết định âm thanh mà phòng thí nghiệm nói rằng chưa tồn tại hay không. Cho đến khi một trong những điều đó thành hiện thực, so sánh giữa Liquid AI d1-omni-600M và LFM2.5-VL-3B vẫn là so sánh giữa một mô hình đã được đo lường và một mô hình có vẻ hợp lý. Đối với công việc chưa được đo lường — đầu vào là giọng nói, đầu ra là phán quyết, đủ nhỏ để nằm trên thiết bị — 600M là checkpoint trọng số mở duy nhất trong họ này đang thử làm điều đó, và việc là người đầu tiên mà không có bảng điểm vẫn là người đầu tiên.
OrcaRouter định tuyến hơn 200 mô hình chỉ qua một API key, với giá niêm yết của từng nhà cung cấp được chuyển nguyên vẹn với mức markup 0% nên khi nhà cung cấp giảm giá, bạn cũng có mức giá đó ngay trong cùng ngày.
