Một thẻ tiêu đề hero có tiêu đề 'Liquid AI d1-3B vs Qwen 3 8B' với tiêu đề phụ 'liệu một khối lượng công việc phân loại 8B có nên chuyển xuống không?', hiển thị một pipeline trong đó một yêu cầu đến phân nhánh thành một hộp d1-3B nhỏ được gắn nhãn 8 ms và 0 token đầu ra và một hộp Qwen 3 8B lớn hơn được gắn nhãn viết câu trả lời, với các chip nhãn và điểm rời khỏi hộp nhỏ và một chip văn xuôi rời khỏi hộp lớn.
Guides & Insights

Liquid AI d1-3B so với Qwen 3 8B: Có nên chuyển một khối lượng công việc phân loại 8B sang một mô hình quyết định không?

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ở đâu đó trong hầu hết các stack production đều có một Qwen 3 8B đang được trả công để trả lời có hoặc không. Nó kiểm duyệt một bình luận, gắn thẻ một phiếu hỗ trợ, quyết định xem một đoạn được truy xuất có liên quan hay không, hoặc chấm điểm đầu ra của một mô hình khác dựa trên một rubric — và nó làm điều đó bằng cách sinh văn bản để một thứ gì đó ở hạ nguồn sau đó phân tích cú pháp. Liquid AI d1-3B, mô hình quyết định 3.12B được Liquid AI mở trọng số vào ngày 7 tháng 10 năm 2026, tồn tại để làm chính xác công việc đó mà không sinh ra gì cả: một trạng thái đầu vào, một tập hợp các câu hỏi có tên đầu vào, và xác suất, nhãn cùng độ tin cậy đầu ra trong một lượt lan truyền xuôi duy nhất với zero token đầu ra. Qwen 3 8B là cỗ máy chủ lực trọng số mở tháng 4 năm 2025 của nhà cung cấp — khoảng 8.2B tham số dense, 119 ngôn ngữ, bật hoặc tắt suy nghĩ theo từng yêu cầu, và mười sáu tháng triển khai trong cộng đồng đằng sau nó. Câu hỏi mà sự kết hợp này thực sự đặt ra thì hẹp và thực tế: với phần lưu lượng của bạn thuộc dạng phân loại, liệu một mô hình tổng quát 8B có phải là cách rẻ nhất để có được một nhãn vào năm 2026, hay hình dạng của công việc đó đã thay đổi bên dưới nó?

Điều bạn đang trả tiền để một 8B làm

Đặt hai hợp đồng đầu ra cạnh nhau và sự kém hiệu quả là mang tính cấu trúc chứ không phải gia tăng.

Một cuộc gọi phân loại Qwen 3 8B là một lần sinh. Bạn viết một prompt mô tả các nhãn, mô hình có thể tùy ý suy luận về đầu vào — và trên mô hình này, bạn có thể bật hoặc tắt suy luận đó theo từng yêu cầu, đây là nút điều chỉnh hữu ích nhất mà nó có cho kiểu công việc này — rồi nó viết trả lại một câu trả lời. Câu trả lời đó là văn bản. Nếu bạn yêu cầu JSON, bạn thường sẽ nhận được JSON, và đôi khi bạn sẽ nhận được JSON nằm trong một câu, hoặc một đoạn mở đầu, hoặc một phần giải thích thêm ở cuối mà bạn không muốn. Nhãn bạn quan tâm nằm ở đâu đó trong luồng token, và một trình phân tích cú pháp trích xuất nó. Bạn bị tính phí cho mọi token mà mô hình viết ra, kể cả những token bạn vứt bỏ.

Liquid AI d1-3B không có luồng token. Các câu hỏi được khai báo với một loại: noul cho có/không, được trả lời dưới dạng P(có) trong khoảng từ 0 đến 1; choice cho một nhãn từ một tập tùy chọn được đặt tên, được trả lời dưới dạng nhãn cộng với độ tin cậy cộng với xác suất cho mỗi tùy chọn; score cho một vị trí trên thang có thứ tự từ hai đến mười, được trả lời dưới dạng mức mong đợi cùng với phân phối và chú giải của nó. Phản hồi mang theo một tổng lũy kế hiển thị output_tokens: 0. Không có gì để phân tích cú pháp vì không có gì được ghi ra, và có một probabilities accessor thô khi bạn muốn phân phối chưa được làm tròn thay vì argmax.

Phần làm thay đổi hóa đơn của bạn là điều xảy ra với nhiều câu hỏi. Một trạng thái có thể mang nhiều thứ: đây có phải là yêu cầu hoàn tiền không, đội nào nên xử lý nó, nó khẩn cấp đến mức nào. Trạng thái và các hình ảnh của nó được đọc một lần, và Liquid báo cáo rằng ba câu hỏi trên một trạng thái tốn 1,3 lần thời gian của một câu thay vì 3 lần. Điều mà nó không gộp lại là phí đầu vào — ghi chú thanh toán của nhà cung cấp nói rõ rằng mỗi câu hỏi được tính như một prompt riêng, bao gồm văn bản và tất cả hình ảnh của nó. Ít độ trễ hơn, cùng số token đầu vào. Đó là một dấu hoa thị trung thực bên cạnh con số hàng đầu, và đó là kiểu điều bạn chỉ tìm thấy khi đọc đoạn về giá thay vì nhìn vào benchmark.

A two-column scoreboard for Liquid AI d1-3B and Qwen 3 8B. The d1-3B column reads: job a closed question answered; 3.12B parameters; output tokens billed 0; 32,768-token context; image input yes; one question in 8 ms on an RTX 4090. The Qwen 3 8B column reads: job text in, text out; about 8.2B dense parameters; output tokens billed every one it writes; 32,768 native context extending to 131,072 via YaRN; image input no; one answer as long as the answer is. The footer reads 'd1-3B figures vendor-reported; Qwen 3 8B figures per Alibaba, April 2025.'

Mười sáu tháng dùng Qwen 3 8B mang lại cho bạn những gì

Trước khi coi mô hình nhỏ hơn là một bản nâng cấp, hãy chính xác về những gì mô hình hiện tại mang lại, bởi vì nó còn hơn cả số lượng tham số.

• Ngữ cảnh — Qwen 3 8B chạy 32.768 token ở mức gốc và mở rộng tới 131.072 token đã được xác thực qua YaRN. Liquid AI d1-3B chạy 32.768 token cố định, không có đường mở rộng nào được ghi nhận. Đối với một trạng thái là một tài liệu dài, 8B là mô hình duy nhất trong hai mô hình có thể chứa được nó.

• Ngôn ngữ — 119 ngôn ngữ và phương ngữ cho Qwen 3 8B so với mười sáu ngôn ngữ được ghi nhận cho Liquid AI d1-3B.

• Kiểm soát suy luận — Qwen 3 8B cho phép bạn bật hoặc tắt tính năng suy nghĩ theo từng yêu cầu. Liquid AI d1-3B không có chế độ suy luận để kiểm soát, điều này có thể là một sự đơn giản hóa hoặc một hạn chế, tùy vào việc bạn đang dùng tính năng suy nghĩ để làm gì.

• Độ rộng — mô hình 8B viết, giải thích, tóm tắt, dịch và viết mã. Liquid AI d1-3B không làm được điều nào trong số đó. Thẻ mô hình của nó nêu rõ ràng: nó không phải là mô hình trò chuyện và nó không viết văn bản.

• Bằng chứng — Qwen 3 8B đã có mười sáu tháng đánh giá chuẩn công khai, lượng tử hóa, tinh chỉnh và sử dụng thực tế trong sản xuất. Điểm Decision Index 48.57 của Liquid AI d1-3B do Liquid tạo ra bằng công cụ chấm điểm chính thức thay vì được gửi lên bảng xếp hạng công khai, và nó mới chỉ vài ngày tuổi, chưa được bên thứ ba tái lập.

• Thị giác — hàng này lại đi theo hướng ngược lại. Liquid AI d1-3B nhận hình ảnh, với việc nhà cung cấp báo cáo 74,1 trên mười một benchmark hình ảnh công khai, được đọc như các quyết định trên tập phương án của từng benchmark, và báo cáo rằng việc loại bỏ hình ảnh khiến cùng những câu hỏi đó sụt xuống còn 45,1. Qwen 3 8B chỉ văn bản cần một mô hình thị giác riêng đứng trước nó để làm được bất kỳ điều nào trong số đó.

• Tốc độ — một câu hỏi trong 8 ms trên RTX 4090, 16 ms trên Jetson AGX Thor, 50 ms trên Jetson Orin Nano, và 64 trạng thái đóng gói mỗi lượt với tốc độ 475 mỗi giây trên 4090. Một bộ phân loại dựa trên thế hệ không có con số tương đương, vì độ trễ của nó phụ thuộc vào độ dài của câu trả lời.

Tóm tắt một cách trung thực là 8B là công cụ tổng quát tốt hơn còn mô hình ra quyết định 3B là lựa chọn chuyên biệt tốt hơn, và câu hỏi duy nhất đáng quan tâm là có bao nhiêu phần lưu lượng của bạn thuộc trường hợp chuyên biệt.

Phép tính chi phí, được thực hiện cẩn thận

Đây là lúc việc so sánh hoặc tự chứng minh được giá trị của nó, hoặc không, nên đáng để thực hiện với cấu trúc thật sự thay vì chỉ là một khẩu hiệu.

Tuyên bố mà Liquid công bố hai ngày trước bản phát hành open-weights là mô hình quyết định được host của họ ngang bằng hoặc vượt GPT-6.1 Sol trên bốn trong sáu ứng dụng thực tế, với chi phí thấp hơn từ 19x đến 200x, và trả lời nhanh hơn ở mọi tác vụ. Hãy đọc phương pháp luận trước khi lặp lại điều đó: mỗi ứng dụng được chạy một lần cho mỗi mô hình vào ngày 5 tháng 10 năm 2026, các mô hình chat trả lời bằng JSON ở thiết lập suy luận mặc định của chúng, và chi phí của d1 được tính ở mức $0.04 cho mỗi triệu token đầu vào. Con số $0.04 đó là mức giá của d1 được host cho đầu vào, và đó là mức giá duy nhất tồn tại — không có dòng đầu ra nào để cộng thêm.

Giờ hãy dựng cùng kiểu ước tính cho một bộ phân loại Qwen 3 8B, và sự bất đối xứng sẽ lộ rõ mà không cần dẫn giá nhà cung cấp của bất kỳ ai. Mô hình 8B có hai dòng tính phí trong khi mô hình ra quyết định chỉ có một, và dòng thứ hai chính là dòng tăng lên: một lượt phân loại suy luận trước sẽ phải trả cho phần suy luận, và một lượt phân loại độn JSON sẽ phải trả cho phần độn. Chi phí đầu vào của mô hình ra quyết định được cố định bởi trạng thái và các câu hỏi. Còn chi phí đầu vào của 8B thì không được cố định bởi bất cứ điều gì bạn có thể dự đoán chỉ từ trạng thái.

Hai đối trọng giữ cho chuyện này không trở thành một thất bại thảm hại. Thứ nhất, mô hình quyết định tính mỗi câu hỏi như một prompt riêng, nên hỏi năm câu về một tài liệu dài sẽ làm đầu vào tăng gấp năm lần — còn 8B hỏi cả năm câu trong một lần gọi và chỉ trả tiền cho tài liệu một lần. Thứ hai, và lớn hơn, một mô hình quyết định chỉ có thể trả lời những câu hỏi mà nó đã được huấn luyện hậu kỳ để trả lời theo dạng đó. Bất kỳ điều gì đòi hỏi một lời giải thích, một bản tóm tắt hoặc một phán đoán diễn đạt bằng lời đều đặt bạn vào mô hình tổng quát và, trên thực tế, quay lại việc phải trả tiền cho cả hai.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and its latency of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Cả hai thực sự giỏi ở điều gì

Bỏ phần benchmark ra thì sự phân tách còn rõ ràng hơn cả những gì mà số lượng tham số gợi ý.

Liquid AI d1-3B dành cho các tác vụ có/không, chọn từ danh sách và chấm điểm, ở mức độ trễ thấp mà không một mô hình sinh nào đạt tới, trên phần cứng bao gồm một Jetson Orin Nano ở 50 ms và một laptop. Các ứng dụng Liquid đã trình diễn vào tháng Mười đều thuộc dạng đó — một vị từ SQL trả lời có hoặc không cho 150 phiếu hỗ trợ, một vòng lặp nén ngữ cảnh của tác nhân giữ lại, cắt gọn hoặc loại bỏ từng đầu ra công cụ và loại bỏ 52% token, một ứng dụng kiểm tra phân loại phụ tùng tốt và lỗi từ bốn dây chuyền sản xuất với độ chính xác 85 đến 97% trên một tác vụ mà nó chưa từng được huấn luyện và hiểu được chỉ từ một mô tả ngắn. Bản demo cuối cùng đó là phát biểu rõ ràng nhất về mục đích của hạng mục này: một công việc mà câu trả lời là một trong số ít khả năng, trạng thái là một hình ảnh, và không có lời giải thích nào từng được yêu cầu.

Qwen 3 8B dành cho những công việc phải trả về dưới dạng ngôn ngữ, hoặc bao quát 119 ngôn ngữ, hoặc chứa một tài liệu dài hơn ba mươi hai nghìn token, hoặc suy luận thành tiếng trước khi đưa ra kết luận. Nó cũng là câu trả lời đúng khi việc phân loại không thuộc một trong ba dạng ở trên — khi tập nhãn là mở, khi các tiêu chí đủ tinh tế đến mức bạn muốn có phần suy nghĩ, khi cùng một lệnh gọi phải xử lý cả trường hợp dễ lẫn trường hợp khó mà bạn không phải định tuyến giữa hai mô hình. Và nó là lựa chọn an toàn khi người đánh giá hỏi có những benchmark độc lập nào, vì câu trả lời là: rất nhiều, có từ một năm rưỡi trước.

Các nhóm làm đúng điều này không chọn một bên. Họ đặt mô hình quyết định trước mô hình đa dụng, trên phần lưu lượng mà câu trả lời là một con số, và để 8B xử lý mọi thứ cần một câu. Bộ lọc là 3B và 8 ms; 8B ở lại cho payload.

Đang triển khai cặp

Liquid AI d1-3B ra mắt dưới dạng trọng số với phần việc triển khai đã được làm sẵn: hỗ trợ llama.cpp ngay ngày đầu, toàn bộ hệ sinh thái NVIDIA từ DGX xuống tận Jetson, lượng tử hóa NVFP4, một biến thể 8-bit cho cả trọng số lẫn kích hoạt, và các bản chuyển đổi GGUF trên Hugging Face. Qwen 3 8B có hệ sinh thái tự lưu trữ sâu rộng nhất so với bất kỳ mô hình nào trong hạng trọng số này. Cả hai đều không nằm trong danh mục của chúng tôi, và không có nội dung nào ở đây là tuyên bố về tính khả dụng cho bất kỳ mô hình nào trong hai — lộ trình dùng dịch vụ lưu trữ cho Liquid AI d1-3B là API của chính nhà cung cấp và các nền tảng bên thứ ba, nơi d1 bản lưu trữ chỉ được tính giá theo token đầu vào ở mức $0,04 mỗi triệu token, với hình ảnh được tính ở 1,5 token cho mỗi ô 32×32 pixel.

Khi cả hai đều nằm trong cùng một pipeline, bài toán định tuyến không còn mang tính lý thuyết nữa. Bạn có một mô hình nhỏ do mình sở hữu, một mô hình 8B bạn có thể tự vận hành hoặc thuê, và các lệnh gọi tạo sinh mà chắc chắn bạn phải thuê — và việc quyết định theo từng yêu cầu xem một đầu vào nhất định nên đi vào mô hình nào chính xác là quyết định mà một lớp định tuyến tồn tại để đưa ra. Một endpoint cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển tiếp nguyên vẹn với mức markup 0%nên khi nhà cung cấp thay đổi giá, bên bạn sẽ được cập nhật ngay trong cùng ngày, tự động chuyển đổi dự phòngđể một buổi chiều tồi tệ của nhà cung cấp thượng nguồn không trở thành sự cố gián đoạn dịch vụ của bạn. Khi lưu lượng phân loại của bạn được đo bằng hàng tỷ lệnh gọi mỗi năm, thì lớp đó chính là nơi khoản tiết kiệm từ một mô hình quyết định 3B thực sự được thu về.

Phán quyết

Nếu 8B của bạn đang bị hỏi những câu hỏi đóng — cái này có độc hại không, cái này có liên quan không, cái này thuộc hàng đợi nào, nó khẩn cấp cỡ nào — thì bạn đang trả hóa đơn hai dòng của một mô hình tổng quát và độ trễ của một lượt sinh chỉ để đổi lấy một nhãn, còn Liquid d1-3B là phương án thay thế trực tiếp với dấu vết bằng chứng yếu hơn và một khác biệt giấy phép thực sự cần cân nhắc. Hãy chấp nhận mức trần ngữ cảnh 32K, mười sáu, và việc chưa có ai ngoài Liquid chấm điểm nó.

Nếu 8B của bạn đang được yêu cầu giải thích, tóm tắt, dịch, ghi nhớ một tài liệu dài hoặc suy luận trước khi quyết định, thì so sánh này không áp dụng cho bạn. Hãy giữ 8B, và chỉ coi mô hình quyết định như một bộ tiền lọc cho lưu lượng mà bạn có thể xác định trước là loại dễ.

Con số đáng để theo dõi không phải là điểm benchmark của mô hình này hay mô hình kia. Mà là việc bản tái lập độc lập đầu tiên của d1 Decision Index xuất hiện nhanh đến mức nào, bởi vì đó chính là thời điểm phép so sánh không còn là lời tuyên bố của nhà cung cấp nữa, mà bắt đầu trở thành một sự thật mà bạn có thể dựa vào để lập kế hoạch.

A capture of our own catalogue page for Qwen3 VL 8B Instruct, showing the model id qwen/qwen3-vl-8b-instruct, a release date of 2025-10-14, text, image and video input, a 131,072-token context window with 32K max output, a P50 time-to-first-token of 3.59 seconds, and pricing of $0.18 per million input tokens against $0.70 per million output tokens.