
Liquid AI d1-3B so với MiniCPM5-2B: Xác suất hay Văn xuôi, ở quy mô máy tính xách tay
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Hai mô hình trọng số mở, cả hai đều đủ nhỏ để chạy trên chính chiếc máy đang ở trước mặt bạn, và chúng không đồng tình về việc một mô hình nên trả lại điều gì. Liquid AI d1-3B là mô hình ra quyết định 3,12B của Liquid AI, được phát hành trọng số mở vào ngày 7 tháng 10 năm 2026: nó đọc một trạng thái và một tập câu hỏi có tên, rồi trả về một nhãn, một xác suất cho mỗi lựa chọn và một độ tin cậy, trong một lượt truyền xuôi, mà không sinh ra gì cả. MiniCPM5-2B là mô hình dense 2,52B của ModelBest và OpenBMB, được giới thiệu tại Hội nghị Trí tuệ Nhân tạo Thế giới vào ngày 19 tháng 7 và âm thầm công bố trên Hugging Face vào đầu tháng 9 năm 2026 theo giấy phép Apache-2.0 — một trợ lý suy luận, lập trình và gọi công cụ, chuyên viết câu trả lời, gọi hàm bằng XML, và đã có hơn một triệu lượt tải xuống. Mô hình nhỏ hơn có cửa sổ ngữ cảnh lớn gấp bốn lần và giấy phép thông thoáng hơn nhiều; mô hình lớn hơn không thể sinh ra một token nào ngay cả khi bạn muốn. Hình dạng nào trong hai hình dạng đó thuộc về pipeline của bạn phụ thuộc hoàn toàn vào việc thứ phía sau lời gọi muốn một con số hay một câu.
Sự đảo ngược đáng chú ý đầu tiên
Gần như mọi kỳ vọng trực giác về cặp này đều ngược lại, nên hãy bắt đầu từ đó.
MiniCPM5-2B là mô hình nhỏ hơn và nó có ngữ cảnh dài hơn: 131,072 token so với 32,768 của Liquid AI d1-3B. Nó cũng là mô hình được cấp phép thoáng hơn trong hai — Apache-2.0, không bị hạn chế, với các bộ dữ liệu huấn luyện được phát hành cùng với trọng số như một phần của họ UltraData. Liquid AI d1-3B được phát hành theo giấy phép lfm1.0 của chính Liquid; mô hình này có thể tải xuống và tinh chỉnh, nhưng giấy phép là giấy phép của nhà cung cấp chứ không phải là giấy phép tiêu chuẩn tự do.
Liquid AI d1-3B là mô hình lớn hơn — 3,12B so với tổng 2,52B, dù phép so sánh lại đảo chiều khi xét đến các tham số phi embedding — và nó là mô hình không thể viết. Nó có thị giác; MiniCPM chỉ xử lý văn bản. Nó được huấn luyện hậu kỳ cho đúng một việc; MiniCPM được huấn luyện hậu kỳ cho nhiều việc. Và trong khi MiniCPM5-2B đi kèm với một biểu đồ so sánh đặt nó ở vị trí dẫn đầu trong phân khúc kích thước của mình, thì Liquid AI d1-3B đi kèm với một điểm chỉ số duy nhất và một bộ bảng độ trễ.
Không điều nào trong số đó khiến cái này tốt hơn cái kia. Nó có nghĩa là cả hai hướng đến những công việc khác nhau, và manh mối nằm ở hình dạng câu trả lời mà mỗi cái trả về.
Cái gì quay lại trên đường truyền
MiniCPM5-2B là một mô hình ngôn ngữ tạo sinh. Nó suy luận, trả lời bằng văn xuôi và phát ra các lệnh gọi công cụ kiểu XML mà bộ phân tích minicpm5 tích hợp sẵn của SGLang chuyển đổi thành tool_calls tương thích với OpenAI mà không cần bộ chuyển đổi tùy chỉnh. Giai đoạn hậu huấn luyện là phần thú vị trong câu chuyện của nó: 400 tỷ token tinh chỉnh có giám sát theo lối suy nghĩ sâu, rồi học tăng cường bằng thuật toán dựa trên critic mượn từ JustRL II, rồi chưng cất on-policy gộp mười sáu giáo viên RL chuyên biệt — năm trong số đó là agentic — trở lại thành một mạng dày đặc. Thẻ mô hình ghi công RL cùng chưng cất với mức tăng trung bình 10,96 điểm trên các tác vụ suy luận và tổng quát và 6,96 trên các tác vụ agentic, và báo cáo mức trung bình 53,9 trên bộ so sánh của chính nó, cao hơn mô hình lớn nhất có trong bộ đó. Đó là các số liệu của ModelBest, được tạo nội bộ, và chưa có bản tái lập độc lập nào được công bố.
Liquid AI d1-3B trả về cấu trúc. Một có/không câu hỏi trả về P(yes) trong khoảng từ 0 đến 1. Một lựa chọn câu hỏi trả về nhãn, độ tin cậy và xác suất cho mỗi tùy chọn. Một điểm câu hỏi trả về mức kỳ vọng trên thang điểm từ hai đến mười có thứ tự, cùng phân phối và chú giải. Đối tượng usage báo cáo output_tokens: 0, và có một probabilities trình truy cập thô nếu bạn muốn các vector chưa qua xử lý. Quá trình hậu huấn luyện của nó là kiểu công việc ngược lại: trung bình hai checkpoint với nhau, tinh chỉnh nhiều seed trên các hỗn hợp dữ liệu khác nhau, hợp nhất chúng, rồi dành công sức cho huấn luyện đầu vào dài, xáo trộn thứ tự các lựa chọn trả lời và loại bỏ các lối tắt khỏi dữ liệu huấn luyện — bởi vì một mô hình ra quyết định học "lựa chọn B thường đúng" thay vì đọc trạng thái thì còn tệ hơn cả vô dụng.
Một bên yêu cầu một mô hình suy nghĩ rồi nói điều gì đó. Bên kia hỏi một mô hình điều nó vốn đã tin.

Cạnh nhau, với nguồn gốc được ghi nhãn
Mọi số liệu dưới đây đều do nhà cung cấp tự báo cáo. Số liệu của MiniCPM5-2B đến từ thẻ mô hình của chính ModelBest và bộ so sánh của chính họ; số liệu của Liquid AI d1-3B đến từ việc Liquid tự chạy công cụ chấm điểm Decision Index chính thức thay vì nộp lên bảng xếp hạng công khai. Tính đến thời điểm phát hành trọng số mở, cả hai mô hình đều chưa được một bên thứ ba đánh giá độc lập.
• Tham số — Liquid AI d1-3B tổng cộng 3,12B với bộ mã hóa thị giác SigLIP2 400M và từ vựng 128.000 token; MiniCPM5-2B tổng cộng 2.516.756.480, 1.981.982.720 không tính embedding, 42 lớp, 16 đầu truy vấn cho 2 đầu KV, từ vựng 130.560.
• Ngữ cảnh — 32.768 token cho Liquid AI d1-3B; 131.072 cho MiniCPM5-2B.
• Các phương thức đầu vào — văn bản và hình ảnh cho Liquid AI d1-3B; chỉ văn bản cho MiniCPM5-2B.
• Đầu ra — xác suất, nhãn, độ tin cậy và điểm số có thứ tự, với zero token đầu ra, cho Liquid AI d1-3B; văn bản được tạo, suy luận và các cuộc gọi công cụ XML cho MiniCPM5-2B.
• Điểm số nổi bật — Liquid AI d1-3B đạt 48,57 trên Decision Index 0.2.1, đứng đầu trong số các mô hình dưới 10B trong bảng của nhà cung cấp; MiniCPM5-2B đạt mức trung bình 53,9 trên bộ so sánh riêng của nó, vốn là một bộ khác đo lường những thứ khác nhau.
• Tốc độ — 8 ms mỗi câu hỏi trên RTX 4090, 26 ms trên Jetson AGX Orin 64 GB, 50 ms trên Jetson Orin Nano, và 64 trạng thái đóng gói mỗi lượt với tốc độ 475 mỗi giây đối với Liquid AI d1-3B. Tốc độ của MiniCPM5-2B phụ thuộc vào số lượng token mà nó tạo ra, vì vậy không có một con số duy nhất để đặt đối diện với nó.
• Giấy phép — Apache-2.0, không hạn chế truy cập, dữ liệu huấn luyện được phát hành, cho MiniCPM5-2B; lfm1.0 của Liquid cho Liquid AI d1-3B.
• Bằng chứng — hơn một triệu lượt tải xuống Hugging Face và một tháng cộng đồng tiến hành lượng tử hoá cho MiniCPM5-2B; hai ngày tồn tại và không có bản chạy thử nào từ bên thứ ba cho Liquid AI d1-3B.
Công việc mà mỗi người thực sự giỏi
Có một quy trình làm việc mà cả hai mô hình đều có thể thực hiện, và sự khác biệt trong cách chúng thực hiện chính là toàn bộ luận điểm.
Giả sử bạn đang phân loại phiếu hỗ trợ, hoặc quyết định xem một đoạn văn bản được truy xuất có trả lời một câu hỏi hay không, hoặc chấm điểm đầu ra của LLM theo một bảng tiêu chí. MiniCPM5-2B có thể làm cả ba — đây là một mô hình suy luận nhỏ nhưng có năng lực, với khả năng gọi công cụ và ngữ cảnh dài, và bạn sẽ chạy nó như bất kỳ trợ lý nào khác, yêu cầu một nhãn rồi phân tích bất cứ thứ gì trả về. Đôi khi nó trả về JSON sạch. Đôi khi nó trả về JSON kèm một phần giải thích bao quanh. Đôi khi nó trả về câu trả lời đúng nhưng sai định dạng, và việc bỏ sót đó là lỗi trong trình phân tích của bạn chứ không phải ở mô hình.
Liquid AI d1-3B không thể làm bất cứ điều gì khác, và đó chính xác là điểm mấu chốt. Trên cùng ba tác vụ, nó trả về một xác suất và một nhãn, không có gì để phân tích cú pháp; ba câu hỏi trên một trạng thái tốn thời gian gấp 1,3 lần so với một câu hỏi, và kiểu lỗi chuyển từ “định dạng bị hỏng” sang “độ tin cậy bị hiệu chỉnh sai” — điều này ít nhất có thể đo lường được, vì độ tin cậy nằm ngay trong phản hồi.
Chỗ MiniCPM5-2B thắng áp đảo là mọi thứ diễn ra sau quyết định đó. Nó giữ được 131K token, nên trạng thái có thể là toàn bộ cây tệp của một kho mã nguồn hoặc một tài liệu dài, thay vì chỉ trang đầu của một tài liệu. Nó viết các lời gọi công cụ theo cách native. Đây là mô hình mà bạn có thể xây dựng một agent nhỏ dựa trên nó, và nó đã được huấn luyện hậu kỳ một cách rõ ràng cho công việc agentic. Và giấy phép Apache-2.0 của nó nghĩa là cuộc trò chuyện thường lệ với luật sư thương mại sẽ không diễn ra.
Điểm mà Liquid AI d1-3B thắng áp đảo là mức trễ tối thiểu và phương thức. Một thiết bị đưa ra quyết định trong 50 ms mà không cần GPU không phải là thiết bị chạy MiniCPM5-2B; hai bên nằm ở những tầng phần cứng khác nhau dù số lượng tham số tương tự. Và 3B nhìn thấy — nhà cung cấp báo cáo 74,1 trên mười một benchmark hình ảnh công khai được diễn giải như các quyết định, so với 73,9 của mô hình thị giác-ngôn ngữ mà nó được xây dựng từ đó, và báo cáo rằng việc loại bỏ hình ảnh khiến chính những câu hỏi đó sụt giảm xuống còn 45,1, đó là cách họ cho thấy các câu trả lời đến từ các pixel. Kiểm tra bằng thị giác một dây chuyền sản xuất hoàn toàn không phải là nhiệm vụ mà 2B chỉ văn bản có thể được giao.

Chạy chúng, và lớp bao quanh chúng
Cả hai đều là những câu chuyện tự vận hành (self-host), và cả hai đều đã hoàn tất phần công việc triển khai. Liquid AI d1-3B ra mắt với hỗ trợ llama.cpp ngay từ ngày đầu, toàn bộ ngăn xếp NVIDIA từ DGX đến Jetson, lượng tử hóa NVFP4, bản dựng 8-bit cho trọng số và activation, cùng các chuyển đổi GGUF đã được công bố. MiniCPM5-2B là kiến trúc LlamaForCausalLM thuần túy, không cần kernel tùy chỉnh, một phân đoạn safetensors BF16, các bản dựng GGUF và MLX trong cả họ mô hình, và tài liệu ghi rõ ưu tiên dùng SGLang khi bạn cần bộ phân tích cú pháp gọi công cụ. Cả hai đều không nằm trong danh mục của chúng tôi, và bài viết này không phải là tuyên bố về tính khả dụng cho bất kỳ mô hình nào trong hai.
Các lựa chọn thay thế dạng lưu trữ (hosted) là API của chính nhà cung cấp và các nền tảng bên thứ ba. Liquid cung cấp phiên bản hosted d1 với mức giá chỉ tính theo token đầu vào là 0,04 USD mỗi triệu token, trong đó hình ảnh được tính như đầu vào với 1,5 token cho mỗi mảng 32×32 pixel và hoàn toàn không có dòng chi phí đầu ra nào; MiniCPM5-2B không có API chính chủ, điều này là bình thường đối với một bản phát hành trọng số mở theo giấy phép Apache-2.0.
Cả hai đều cùng đổ vào một vấn đề kiến trúc. Một mô hình 2B hoặc 3B chạy cục bộ đảm nhận phân loại, định tuyến hoặc kiểm tra guardrail, nằm ngay trước các lệnh gọi sinh tạo mà bạn không tự vận hành, và sự pha trộn đó — suy luận thuộc sở hữu của bạn đặt cạnh suy luận của người khác — chính là thứ mà một lớp định tuyến sinh ra để hấp thụ. Một endpoint duy nhất xuyên suốt hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển thẳng qua với mức markup 0% để khi nhà cung cấp đổi giá là có hiệu lực ngay trong cùng ngày, tự động chuyển đổi dự phòng khi một upstream suy giảm. Việc sở hữu mô hình nhỏ khiến câu hỏi định tuyến trở nên khó hơn chứ không dễ hơn, bởi vì giờ đây ranh giới giữa phần cứng của bạn và phần cứng của người khác là một quyết định bạn phải đưa ra cho từng yêu cầu một.
Chọn theo loại
Nếu thứ bạn cần là một nhãn, một xác suất hay một mức đánh giá, và tập lựa chọn đã biết trước, thì Liquid AI d1-3B là công cụ trung thực hơn — nó được tạo ra cho yêu cầu đó và câu trả lời sẽ không đến trong tình trạng hỏng định dạng. Hãy chấp nhận giấy phép nhà cung cấp, ngữ cảnh 32K và dấu vết bằng chứng đã hai ngày tuổi như cái giá phải trả.
Nếu thứ bạn cần là một mô hình nhỏ có thể suy luận, gọi công cụ, giữ một tài liệu dài và trả lời bằng lời, thì MiniCPM5-2B là cỗ máy có năng lực hơn hẳn, và nó đi kèm với Apache-2.0 cùng sự kiểm chứng của người khác đáng giá một triệu lượt tải về ở phía sau.
Những đội thu được nhiều nhất từ một trong hai bản phát hành là những đội đang vận hành cả hai: một mô hình ra quyết định ở phía trước, nơi câu trả lời là một con số và từng mili giây đều quan trọng, cùng một mô hình tạo sinh nhỏ ở phía sau, dành cho những phần của công việc cần đến ngôn ngữ. Chúng không phải là đối thủ cạnh tranh. Chúng là một bộ lọc và một người nói.

