Thẻ tiêu đề hero cho các mô hình ra quyết định trọng số mở của Liquid AI, với tiêu đề 'hai mô hình không bao giờ viết một từ nào' và tiêu đề phụ 'Liquid AI d1-3B và d1-omni-600M, mở, ngày 7 tháng 10 năm 2025', ba chip được dán nhãn có/không, chọn một nhãn và đánh giá trên một thang điểm, cùng một sơ đồ về một trạng thái đi vào một lượt truyền xuôi duy nhất trả về một xác suất, một nhãn và một điểm số.
Guides & Insights

Liquid AI d1-3B và d1-omni-600M: Trọng số mở cho các mô hình không bao giờ viết một chữ nào

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Liquid AI d1-3B và Liquid AI d1-omni-600M đã được đăng tải lên Hugging Face vào ngày 7 tháng 10 năm 2026, và hai checkpoint này sở hữu một đặc tính khiến mọi bảng so sánh bạn từng đọc trong năm nay đều mang hình dạng sai. Cả hai đều không sinh văn bản. Bạn đưa cho Liquid AI d1-3B một trạng thái — một phiếu hỗ trợ, một payload JSON, một bức ảnh, hoặc cả ba cùng lúc — cùng một tập các câu hỏi có tên, và nó trả về những câu trả lời được nhặt thẳng ra từ phân phối của mô hình trên các lựa chọn của bạn. Có/không dưới dạng xác suất. Một lựa chọn giữa các nhãn kèm độ tin cậy và một vector xác suất đầy đủ. Một vị trí trên thang đo có thứ tự. Không có bước lấy mẫu, không có JSON để phân tích cú pháp, không có sinh văn bản vượt kiểm soát, và bộ đếm sử dụng của chính nhà cung cấp báo cáo điều đó một cách rõ ràng: output_tokens: 0. Mô hình 3B là tâm điểm — nó đạt 48,57 trên Decision Index 0.2.1 do nhà cung cấp chấm điểm, vượt qua mọi thứ dưới 10B và vượt qua cả một mô hình quyết định có kích thước lớn gấp mười hai lần nó. Người anh em 600M mới là cái đáng để theo dõi: nó đọc hình ảnh và tối đa ba mươi giây âm thanh qua cùng bộ trọng số trunk, và nó được dán nhãn là bản phát hành nghiên cứu sớm.

Mô hình quyết định là gì, trong một đoạn văn.

Phạm trù này đã được định hình suốt một năm qua dưới những cái tên như mô hình hệ một và bộ phân loại-không-phải-bộ-phân-loại, và cặp d1 là tuyên bố rõ ràng nhất về nó cho đến nay. Một mô hình sinh được hỏi một câu hỏi và viết ra câu trả lời; câu trả lời phải được phân tích cú pháp, việc phân tích có thể thất bại, và mỗi token nó viết ra đều tốn tiền và thời gian của bạn. Một mô hình quyết định được hỏi một câu hỏi và báo cáo điều nó đã tin sẵn. Các câu hỏi của Liquid có ba loại. noul là câu hỏi có/không, được trả lời bằng P(có) nằm giữa 0 và 1. choice chọn một nhãn từ một tập hợp có tên và trả về nhãn, độ tin cậy, và xác suất của từng tùy chọn. score đặt trạng thái trên một thang có thứ tự từ hai đến mười mức và trả về mức dự kiến cùng phân phối và chú giải của nó. Một trạng thái có thể mang nhiều câu hỏi cùng lúc, và trạng thái cùng các hình ảnh của nó được đọc một lần cho tất cả chúng.

Thuộc tính cuối cùng đó chính là toàn bộ lý lẽ kinh doanh. Ba câu hỏi về cùng một ticket chỉ tốn thời gian gấp 1,3 lần so với một câu hỏi, chứ không phải gấp 3 lần, vì mô hình chỉ thực hiện một lượt lan truyền xuôi trên đầu vào và đọc ra nhiều câu trả lời từ đó. Không có gì để viết, nên cũng không có gì để viết dở.

3B và 600M được xây dựng từ hai hướng đối lập nhau

Đây là chỗ bản phát hành trở nên thú vị về mặt kỹ thuật, và đây cũng là phần mà các bài đưa tin về buổi ra mắt phần lớn đã bỏ qua. Hai mô hình không cùng chung một dòng phát triển.

Liquid AI d1-3B bắt nguồn từ LFM2.5-VL-3B, mô hình ngôn ngữ-thị giác chỉ dùng decoder của nhà cung cấp. Nó có 3,12 tỷ tham số, bộ mã hóa thị giác 400 triệu được tối ưu hóa hình dạng SigLIP2 NaFlex, cửa sổ ngữ cảnh 32.768 token, vốn từ 128.000 token và mười sáu ngôn ngữ được ghi nhận trong tài liệu. Để xây dựng nó, Liquid đã lấy trung bình trọng số của LFM2.5-2.6B và phần xương sống văn bản của LFM2.5-VL-3B, tinh chỉnh các checkpoint từ nhiều hạt ngẫu nhiên và hỗn hợp dữ liệu khác nhau, rồi hợp nhất lại các kết quả. Bản tóm tắt của chính nhà cung cấp về điều gì thực sự quan trọng lại tươi mới đến mức không hào nhoáng: huấn luyện trên các đầu vào dài, xáo trộn thứ tự các lựa chọn câu trả lời và truy tìm các lối tắt trong dữ liệu huấn luyện đã đóng góp nhiều hơn cho con số cuối cùng so với bất kỳ kỹ thuật tiên tiến nào.

Liquid AI d1-omni-600M bắt nguồn từ LFM2.5-Encoder-350M, một bộ mã hóa hai chiều — một giống mạng hoàn toàn khác. Nó có tổng cộng 587 triệu tham số, chia thành 381 triệu tham số cho thân dùng chung và đầu quyết định, 94 triệu tham số cho bộ mã hóa thị giác mượn từ LFM2.5-VL-450M, và 112 triệu tham số cho bộ mã hóa âm thanh được xây dựng từ FastConformer 17 lớp. Mọi phương thức đều chạy qua cùng một trọng số thân. Ngữ cảnh của nó là 16.384 token bao gồm cả vị trí văn bản, hình ảnh và âm thanh cùng nhau, và khi có hình ảnh đính kèm, văn bản trạng thái và câu hỏi bị cắt xuống còn 896 token vì đó là những gì nó được huấn luyện. Âm thanh nhận một cảnh báo mà thẻ nêu thẳng thắn, không úp mở: năng lực này được huấn luyện trên các yêu cầu giữa một người nói tiếng Anh và một trợ lý, và các clip bị cắt ở mốc ba mươi giây.

Vậy nên họ mô hình này không phải là một mô hình với hai kích cỡ. Đó là một decoder và một encoder, được hậu huấn luyện để làm cùng một công việc bằng hai cơ chế hoàn toàn khác nhau, một cái thì nhìn và một cái thì nghe.

A two-column scoreboard for Liquid AI d1-3B and d1-omni-600M showing d1-3B at Decision Index 48.57 with 3.12B parameters, text and image input and 8 ms per question on an RTX 4090, against d1-omni-600M at 15.95 with 587M parameters, text, image and audio input and no reported latency, footed 'All figures vendor-reported by Liquid AI, Oct 7 2026; no independent reproduction.'

Những con số, và chúng thuộc về ai

Mọi số liệu trong phần này đều là của riêng Liquid. Các hàng Decision Index cho các mô hình d1 được nhà cung cấp chấm điểm bằng công cụ chấm điểm chính thức — không được gửi lên bảng xếp hạng — trong khi mọi hàng đối thủ đều đến từ bảng xếp hạng công khai ở v0.2.1. Chưa có phòng thí nghiệm độc lập nào tái lập được bất kỳ kết quả nào trong số đó, và tính đến thời điểm viết bài này, các mô hình mới chỉ ra đời được hai ngày.

• Decision Index 0.2.1 — Liquid AI d1-3B đạt 48,57 điểm với các điểm thành phần Kiến thức 23,8, Ngôn ngữ 56,4, Truy xuất 52,8, Công cụ 74,5 và Nghệ thuật 36,3. Liquid AI d1-omni-600M đạt 15,95 điểm, với Công cụ ở mức 15,1.

• Vị trí của 48.57 — đứng đầu trong mọi thứ dưới 10B trong bảng mà nhà cung cấp đã công bố, và xếp trên Decider 35B-A3B ở 47.11. Nó đứng thứ hai tổng thể, sau Winnow-12B ở 50.02, với kích thước gấp bốn lần.

• Các benchmark văn bản, do nhà cung cấp báo cáo — d1-3B đạt trung bình 82,9 trên bảy benchmark công khai, cao hơn mức 81,1 của Decider 4B; d1-omni-600M đạt trung bình 78,4, vượt qua mức 77,1 của Decider 2B với số lượng tham số chỉ bằng khoảng một phần tư. Mẫu 600M đạt điểm độc hại tốt nhất trong bảng (Civil Comments 95,8) và điểm diễn đạt lại tốt nhất (PAWS-X 79,5).

• 视觉,厂商报告 — d1-3B 在十一项公开图像基准测试中平均得分为 74.1(按对每项基准选项的决策来解读),而其 LFM2.5-VL-3B 主干模型为 73.9。移除图像后,相同问题降至 45.1,厂商借此表明答案源自像素。

• Độ trễ, do nhà cung cấp đo — một câu hỏi mất 8 ms trên RTX 4090 và 9 ms trên AMD MI325X; 16 ms trên Jetson AGX Thor, 26 ms trên Jetson AGX Orin 64 GB, 50 ms trên Jetson Orin Nano nhỏ nhất, và 30 ms trên Apple M5 Pro. Sáu mươi tư trạng thái được gói trong một lượt chạy đạt tốc độ 475 mỗi giây trên 4090.

• Những gì còn thiếu — d1-omni-600M hoàn toàn không có bảng suy luận nào. Liquid cho biết nó đang được phát triển tích cực và đơn giản là không báo cáo độ trễ cho nó. Cũng không có bất kỳ benchmark ra quyết định âm thanh nào ở bất cứ đâu trong bản phát hành, bởi vì, theo lời của nhà cung cấp, các benchmark ra quyết định âm thanh chuyên dụng hiện đang là một bài toán mở.

Tuyên bố mà bản phát hành thực sự đưa ra

Hai ngày trước khi trọng số được đăng lên, Liquid đã công bố phiên bản hosted của mô hình này và chạy nó đối đầu với GPT-6.1 Sol và Claude Opus 5.5 trên sáu ứng dụng. Tóm tắt của họ: d1 ngang bằng hoặc đánh bại GPT-6.1 Sol trên bốn trong số sáu, có chi phí thấp hơn từ 19 lần đến 200 lần, và trả lời nhanh hơn trong mọi tác vụ. Phương pháp luận được công bố đáng để đọc trước khi lặp lại bất kỳ điều nào trong số đó — mỗi ứng dụng được chạy một lần cho mỗi mô hình vào ngày 5 tháng 10 năm 2026, các mô hình chat trả lời bằng JSON ở thiết lập suy luận mặc định của chúng, và chi phí của d1 được tính ở mức $0.04 cho mỗi triệu token đầu vào.

Những bản demo mới là phần thuyết phục hơn. Phân loại linh kiện tốt và bị lỗi từ bốn dây chuyền sản xuất — bo mạch, nến, hạt điều, kẹo cao su — với độ chính xác từ 85 đến 97%, trên một mô hình chưa từng được huấn luyện cho tác vụ đó và đã hiểu nó từ một mô tả ngắn. Một vị từ SQL trả lời có hoặc không cho từng vé hỗ trợ trong 150 vé. Một vòng lặp nén ngữ cảnh đọc từng đầu ra công cụ trong phiên của một tác nhân lập trình và giữ lại, cắt bớt hoặc loại bỏ nó, giảm 52% token trong khi vẫn giữ mọi đầu ra mà tác vụ cần. Trong Tetris, việc thêm màn hình vào một trò chơi hoàn toàn có thể mô tả bằng văn bản đã nâng điểm từ 70 dòng đã xóa lên 81 — một kết quả thị giác mà bạn không thể có được từ một bộ phân loại chỉ dùng văn bản, cho dù nó tốt đến đâu.

Đó là những minh họa do nhà cung cấp thực hiện với các nhiệm vụ do nhà cung cấp chọn, và phần phương pháp luận đã nói rõ điều đó. Dù vậy, chúng vẫn là bức tranh rõ ràng nhất mà bất kỳ ai đã công bố về mục đích của một mô hình ra quyết định.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57, and its latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Nơi nó chạy và chi phí để gọi

Các trọng số mở được thiết kế để chạy cục bộ và nhà cung cấp đã làm sẵn phần tích hợp ngay từ đầu: hỗ trợ llama.cpp ngay ngày đầu tiên, toàn bộ hệ sinh thái NVIDIA từ DGX xuống tận Jetson, lượng tử hóa NVFP4, và một biến thể trọng số/kích hoạt 8-bit được công bố song song với checkpoint cơ sở. Các bản chuyển đổi GGUF đã có sẵn trên Hugging Face. Nếu bạn không muốn tự lưu trữ bất cứ thứ gì, Liquid phục vụ bản hosted d1 từ API riêng của mình — chỉ tính token đầu vào, không tính token đầu ra, với hình ảnh được tính như đầu vào ở mức 1,5 token cho mỗi vùng 32×32 pixel, khiến một hình ảnh 1024×1024 thành 1.536 token. Truy cập chỉ dùng văn bản cũng có sẵn thông qua các nền tảng bên thứ ba.

Ghi chú định tuyến trung thực: cả Liquid AI d1-3B lẫn Liquid AI d1-omni-600M đều không nằm trong danh mục của chúng tôi, và bài viết này không phải là một tuyên bố về tính sẵn có của bất kỳ mô hình nào trong hai mô hình đó. Điều mà cặp d1 thay đổi đối với một router chính là hình dạng của pipeline bao quanh nó. Một mô hình ra quyết định trả lời trong vài mili giây và không tốn token đầu ra là một bộ lọc, chứ không phải một thứ thay thế — việc phân loại hàng tốt và hàng lỗi cũng như việc phân loại phiếu hỗ trợ diễn ra trước lệnh gọi sinh tạo, và chính lệnh gọi sinh tạo là nơi một endpoint duy nhất xuyên suốt hơn 200 mô hình, giá niêm yết được chuyển tiếp với mức chênh lệch 0%, và chuyển đổi dự phòng tự động thực sự phát huy giá trị.

Điều gì sẽ giải quyết được cuộc tranh cãi

Ba điều vẫn chưa được giải quyết, và cả ba đều thuộc loại chỉ có thời gian mới khép lại được.

Điều thứ nhất là tái tạo độc lập. Các con số của Decision Index được nhà cung cấp tạo ra bằng bộ chấm điểm chính thức, và mỗi dòng của đối thủ đều được lấy từ một bảng xếp hạng công khai — đó là một cách làm có thể biện minh được, và không giống với việc một bên thứ ba tự chạy mô hình của bạn. Điều thứ hai là. Một checkpoint 600M định tuyến một lệnh thoại trong một lượt lan truyền xuôi là một năng lực thực sự mới, và không tồn tại bất kỳ benchmark nào đo lường liệu nó có làm việc đó tốt hay không. Điều thứ ba là chính phạm trù đó: khi câu trả lời được đọc ra từ một phân phối thay vì được viết ra, những kiểu thất bại thường gặp của một mô hình nhỏ — lặp vòng, trôi dạt, từ chối, ảo giác ra một định dạng — đơn giản là không thể xảy ra, và chưa ai công bố một bản mô tả thỏa đáng về những gì thay thế chúng. Sai số hiệu chuẩn là ứng viên hiển nhiên, và đó chính xác là điều mà trường độ tin cậy trên mỗi câu trả lời mời gọi bạn tự mình đo lường.

Mười bản demo chạy Liquid AI d1-3B theo vòng lặp trên luồng camera trực tiếp trong một không gian Hugging Face công khai, đây là cách rẻ nhất để bạn tự hình thành ý kiến của riêng mình. Các trọng số được miễn phí và các câu hỏi thì cụ thể. Đó là một điểm xuất phát tốt hơn so với hầu hết các bản phát hành trong năm nay.

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày