
Liquid AI d1-3B so với LFM2.5-2.6B-Base: Mô hình quyết định và tổ tiên của chính nó
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Đây không phải là cuộc đối đầu giữa hai đối thủ. Liquid AI d1-3B, mô hình quyết định trọng số mở mà Liquid AI công bố vào ngày 7 tháng 10 năm 2026, được xây dựng trên một nền tảng mà nhà cung cấp tạo ra bằng cách lấy trung bình trọng số của LFM2.5-2.6B với trục văn bản của LFM2.5-VL-3B. LFM2.5-2.6B-Base là mô hình cha đầu tiên đó — checkpoint tiền huấn luyện thô mà Liquid đã tải lên vào ngày 1 tháng 8 năm 2026, 2,69 tỷ tham số, 34 nghìn tỷ token huấn luyện, ngữ cảnh 131.072 token, không tinh chỉnh theo chỉ dẫn và không có mẫu trò chuyện. Vậy nên cách diễn đạt trung thực của so sánh này là hậu duệ đối đầu với tổ tiên: một mô hình đã được huấn luyện sau thành một công việc rất cụ thể, đứng cạnh nền tảng chưa được định hình mà từ đó nó được tạo hình. Một trong hai sẽ trả lời câu hỏi tối nay. Cái còn lại là nơi bạn bắt đầu nếu câu hỏi bạn cần được trả lời không phải là câu hỏi mà bất kỳ ai đã từng hỏi.
Thực tế mỗi thứ là gì
Hai thẻ mô hình đọc như những tài liệu từ các giai đoạn khác nhau của một dây chuyền sản xuất, và những khác biệt không nằm ở phong cách.
Liquid AI d1-3B sở hữu 3,12 tỷ tham số, một bộ mã hóa thị giác SigLIP2 NaFlex 400M, cửa sổ ngữ cảnh 32.768 token, vốn từ 128.000 token và mười sáu ngôn ngữ được ghi nhận. Đây là một mô hình ra quyết định: bạn đưa cho nó một trạng thái cùng các câu hỏi có tên, và nó trả về một xác suất có/không, một nhãn được chọn kèm độ tin cậy và toàn bộ phân phối các lựa chọn, hoặc một điểm số có thứ tự — chỉ trong một lượt truyền xuôi duy nhất, không sinh ra token đầu ra nào. Nó cung cấp một lệnh gọi system_one cho một trạng thái với nhiều câu hỏi, một biến thể theo lô gộp nhiều yêu cầu mà không cần đệm, và một probabilities truy cập thô cho các phân phối bên dưới. Đây không phải là mô hình hội thoại và không viết văn bản, và thẻ mô hình nói đúng nguyên văn như vậy.
LFM2.5-2.6B-Basemang 2,69 tỷ tham số trong 30 lớp — 22 khối tích chập ngắn có cổng kép và 8 khối attention truy vấn nhóm — được huấn luyện trên 34 nghìn tỷ token và được mở rộng lên ngữ cảnh 131.072 token trong giai đoạn huấn luyện giữa kỳ, với cùng bộ từ vựng 128.000 token và cùng mười sáu ngôn ngữ. Đây là một checkpoint chỉ văn bản đã được tiền huấn luyện, không có tinh chỉnh theo chỉ dẫn, không có benchmark nào trên model card, và một khuyến nghị đọc như cảnh báo: chỉ dùng nó cho những tác vụ đòi hỏi phải tinh chỉnh nhiều. Nó hoàn thành văn bản. Nó không tuân theo chỉ dẫn.
Cả hai đều là bản tải xuống không qua cổng theo giấy phép mở của chính Liquid. Cả hai đều lấy văn bản làm trọng tâm. Cả hai đều không có trong danh mục của chúng tôi, và không có nội dung nào ở đây là tuyên bố về tính khả dụng dành cho cả hai.

Dòng dõi là phần thú vị.
Liquid không tinh chỉnh một mô hình hoàn toàn mới để tạo ra bản phát hành d1. Công ty đã lấy trung bình hai checkpoint — LFM2.5-2.6B và text tower của LFM2.5-VL-3B — để có điểm khởi đầu tốt hơn, sau đó tinh chỉnh nhiều lần chạy với các seed ngẫu nhiên và hỗn hợp dữ liệu khác nhau rồi hợp nhất chúng trở lại với nhau. Lời kể của nhà cung cấp về những gì đã cải thiện kết quả đáng chú ý là không hề có kỹ thuật cao siêu nào: huấn luyện trên các đầu vào dài, xáo trộn thứ tự xuất hiện của các phương án trả lời, và loại bỏ các đường tắt khỏi dữ liệu huấn luyện đã đóng góp nhiều hơn bất kỳ phương pháp tiên tiến nào họ đã thử.
Chi tiết về việc loại bỏ lối tắt đó đáng để dừng lại suy ngẫm, vì nó gọi tên đúng kiểu thất bại mà hạng mục này tồn tại để tránh. Một mô hình được huấn luyện để trả lời các câu hỏi trắc nghiệm sẽ dễ dàng học rằng lựa chọn B thường đúng, hoặc rằng lựa chọn dài nhất sẽ thắng. Việc xáo trộn thứ tự lựa chọn trong quá trình huấn luyện chính là thứ ngăn điều đó lại. Một mô hình ra quyết định đã học được một tiên nghiệm về vị trí thay vì đọc trạng thái thì còn tệ hơn vô dụng — nó sai một cách đầy tự tin ở quy mô lớn — và đó chính là điểm phân biệt một mô hình ra quyết định thực sự với một bộ phân loại có kèm prompt.
Cũng có một sự thoái bộ đáng được gọi tên thẳng thắn, bởi vì nhà cung cấp không làm vậy: checkpoint cơ sở có cửa sổ ngữ cảnh 131,072 token và Liquid AI d1-3B có 32,768. Việc hậu huấn luyện thành một mô hình quyết định đã tốn mất ba phần tư ngữ cảnh khả dụng. Nếu bạn tưởng tượng rằng hậu duệ thống trị hoàn toàn tổ tiên của nó trên mọi trục, thì không phải vậy, và các quyết định với tài liệu dài là trục mà checkpoint cũ hơn có nhiều không gian hơn — về nguyên tắc, mặc dù nó không có đầu quyết định để dùng không gian đó.
Bảng điểm, cùng với sự bất đối xứng đi kèm
Việc so sánh hai mô hình này trên các benchmark là một lỗi phạm trù, nhưng đó là một lỗi phạm trù có hình dạng đầy thông tin, nên đây là kết quả với các lưu ý được đặt đúng chỗ. Mọi số liệu của d1-3B đều là của chính Liquid, được nhà cung cấp chấm điểm bằng trình chấm điểm chính thức thay vì gửi lên một bảng xếp hạng công khai, và không được bất kỳ bên thứ ba nào tái lập. Mọi số liệu của LFM2.5-2.6B-Base đều vắng mặt vì một mô hình base không có gì để đo lường.
• Decision Index 0.2.1 — Liquid AI d1-3B 48.57, đứng đầu trong số mọi thứ dưới 10B trong bảng của nhà cung cấp và xếp trên một mô hình quyết định lớn gấp mười hai lần nó. LFM2.5-2.6B-Base — không được chấm điểm, không thể chấm điểm nếu không có đầu quyết định.
• Các bài kiểm chuẩn văn bản — Liquid AI d1-3B đạt trung bình 82,9 trên bảy bài kiểm chuẩn công khai bao gồm khả năng hiểu, độc tính, ý định, hỏi đáp y khoa và hiểu biết đa ngôn ngữ. LFM2.5-2.6B-Base không công bố bảng kiểm chuẩn nào cả.
• Thị giác — Liquid AI d1-3B đạt trung bình 74,1 trên mười một bài kiểm chuẩn hình ảnh được hiểu như các quyết định; khi bỏ hình ảnh, các câu hỏi tương tự giảm xuống còn 45,1. LFM2.5-2.6B-Base chỉ có văn bản, không có tháp thị giác.
• Tham số — 3,12B so với 2,69B. Mô hình ra quyết định là mô hình lớn hơn trong hai, điều này ngược với câu chuyện hậu huấn luyện thường thấy.
• Ngữ cảnh — 32,768 token so với 131,072. Tổ tiên thắng hàng này và đây là hàng duy nhất nó thắng.
Độ trễ — Liquid AI d1-3B trả lời một câu hỏi trong 8 ms trên RTX 4090 và 50 ms trên Jetson Orin Nano, đồng thời chạy 64 trạng thái đóng gói ở tốc độ 475 mỗi giây trên 4090. LFM2.5-2.6B-Base không có độ trễ nào để báo cáo cho đến khi bạn tinh chỉnh nó thành một thứ có thể trả lời câu hỏi, và khi đó con số chính là của bản tinh chỉnh của bạn.

Thực tế thì bạn đang lựa chọn giữa những gì
Quy tắc ra quyết định ở đây rõ ràng một cách lạ thường, bởi vì hai điểm kiểm tra không phải tranh nhau cùng một dòng ngân sách.
Hãy dùng Liquid AI d1-3B khi câu hỏi đã tồn tại và thuộc một trong ba dạng mà một mô hình quyết định xử lý: có/không, chọn từ một tập hợp có tên, hoặc đánh giá trên một thang có thứ tự. Các ứng dụng đã công bố đều là những công việc sản xuất dễ nhận ra — phân loại ưu tiên và định tuyến, kiểm duyệt, phân loại ý định và chủ đề, kiểm tra trích xuất, xếp hạng lại, rào chắn cho tác nhân, và kiểm tra trực quan. Các con số demo mà nhà cung cấp chạy vào ngày 5 tháng 10 đặt d1 đối đầu với GPT-6.1 Sol và Claude Opus 5.5 trên sáu tác vụ như vậy và tuyên bố nó ngang bằng hoặc đánh bại GPT-6.1 Sol ở bốn tác vụ trong khi chi phí thấp hơn từ 19 lần đến 200 lần; trang phương pháp nói rõ rằng mỗi ứng dụng chỉ được chạy một lần cho mỗi mô hình, nên hãy coi hình dạng của tuyên bố là phát hiện, chứ không phải các chữ số thập phân. Cái thực sự gây ấn tượng là demo kiểm tra: phân loại tốt so với lỗi trên bốn dây chuyền sản xuất với độ chính xác 85 đến 97% ở một tác vụ mà mô hình chưa từng được huấn luyện, được hiểu từ một mô tả ngắn.
Hãy chọn LFM2.5-2.6B-Base khi câu hỏi còn chưa tồn tại. Đây là điểm khởi đầu rẻ hơn cho một bản fine-tune mà bạn định sở hữu — một đầu quyết định theo miền, một bộ phân loại riêng, một tác vụ mà chưa ai có checkpoint. Bạn kế thừa kiến trúc, tokenizer và ngữ cảnh dài, rồi phải trả bằng tài nguyên tính toán, dữ liệu và đánh giá. Hai trong bốn ứng dụng mà nhà cung cấp xây dựng quanh d1 khởi đầu từ các dự án mã nguồn mở thay vì làm từ số không, một bức tranh công bằng về những gì mà một checkpoint nền cộng với kỷ luật thực sự tạo ra.
Cái bẫy thực tế nằm ở việc coi checkpoint cơ sở như một thứ cắm-là-chạy. Nó không phải là một trợ lý, nó sẽ không tuân theo prompt, và khi được đánh giá như một mô hình trò chuyện thì nó đạt điểm gần bằng không — đó không phải là sự thật về chất lượng của nó, mà là sự thật về ý nghĩa của chữ "base".
Tự host một trong hai, và lớp ở trên
Cả hai đều đến dưới dạng trọng số, và nhà cung cấp đã làm phần việc triển khai cho phía d1: hỗ trợ llama.cpp ngay từ ngày đầu, toàn bộ ngăn xếp NVIDIA từ DGX xuống tới Jetson, lượng tử hóa NVFP4, một biến thể 8-bit cho cả trọng số lẫn kích hoạt, và các bản chuyển đổi GGUF trên Hugging Face. Checkpoint cơ sở có các biến thể GGUF, ONNX và MLX của riêng nó thông qua dòng họ LFM2.5 rộng lớn hơn. Nếu bạn không muốn tự lưu trữ bất cứ thứ gì, Liquid phục vụ phiên bản lưu trữ của d1 từ API của riêng họ, với giá chỉ tính trên token đầu vào, còn hình ảnh được tính phí ở mức 1,5 token cho mỗi mảng 32×32 pixel; truy cập chỉ văn bản cũng có sẵn thông qua các nền tảng của bên thứ ba.
Điều mà cả hai con đường đều không thay đổi chính là phần còn lại của stack. Một mô hình bạn tự host là một mô hình bạn phải duy trì hoạt động, quản lý phiên bản và chuyển đổi dự phòng — và những quyết định mà nó đưa ra vẫn nằm ngay cạnh các lệnh gọi generative mà bạn không tự host. Sự kết hợp đó chính là lớp mà một router thu gọn lại: một endpoint duy nhất xuyên suốt hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên với mức markup 0% để khi nhà cung cấp thay đổi giá thì phía bạn đã cập nhật ngay trong cùng ngày, và chuyển đổi dự phòng tự động để một buổi chiều trục trặc của một upstream không trở thành sự cố ngừng dịch vụ của bạn. Việc tự host một mô hình ra quyết định 3B ngay bên cạnh đó khiến câu hỏi về routing trở nên sắc nét hơn chứ không hề nhẹ nhàng hơn, bởi vì giờ đây bạn sở hữu một nửa pipeline và thuê nửa còn lại.
Cái nào, cho ai
Nếu câu hỏi bạn cần được trả lời trong tuần này thuộc một trong ba dạng mà một mô hình ra quyết định có thể có, và đó là câu hỏi mà người khác đã hình dung ra rồi, thì bản hậu duệ đã hoàn thiện, miễn phí và chạy trong 50 ms trên một thiết bị không có GPU — hãy dùng Liquid AI d1-3B và thế là xong.
Nếu bạn đang xây dựng thứ sẽ trả lời một câu hỏi mà chưa ai từng đặt ra, và bạn có dữ liệu cùng năng lực tính toán để làm chủ điều đó, thì LFM2.5-2.6B-Base là điểm khởi đầu trung thực, và điều đáng biết là hậu duệ trong bài viết này được tạo ra từ nó bằng đúng con đường mà bạn sắp đi.
Và nếu bạn không chắc mình đang ở tình huống nào trong hai tình huống đó, thì câu trả lời gần như luôn là tình huống thứ nhất. Post-training thành một decision head là nước đi tốn kém; chạy cái của người khác thì miễn phí.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
