Thẻ tiêu đề hero có tiêu đề 'Liquid AI d1-3B vs Gemma 4 12B' với tiêu đề phụ 'một mô hình ra quyết định đối đầu với một mô hình tổng quát', hiển thị một thẻ danh sách kiểm tra 3.12B nhỏ với chip xác suất bên cạnh một thẻ 11.96B lớn hơn mang các biểu tượng tài liệu, dạng sóng và khung phim cùng một chip câu trả lời bằng văn bản.
Guides & Insights

Liquid AI d1-3B vs Gemma 4 12B: Một mô hình quyết định đối đầu với một mô hình đa năng

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cách nhanh nhất để khiến phép so sánh này sai là đặt Liquid AI d1-3B và Ge​mma 4 12B lên cùng một benchmark rồi chờ đợi một người thắng. Chúng không trả lời cùng một câu hỏi. Liquid AI d1-3B là một mô hình quyết định 3,12B được phát hành dưới dạng trọng số mở vào ngày 7 tháng 10 năm 2026: bạn đưa cho nó một trạng thái và một tập hợp các câu hỏi được đặt tên, và nó trả về xác suất, một nhãn được chọn và độ tin cậy, với 0 token đầu ra và không có bước sinh. Ge​mma 4 12B là mô hình tổng quát any-to-any không dùng encoder của Goo​gle, một checkpoint 11,96B nhận văn bản, hình ảnh, âm thanh và video rồi viết câu trả lời trong cửa sổ 256.000 token bằng hơn 140 ngôn ngữ. Một trong hai cho bạn biết bo mạch là một trong bốn thứ nào. Cái kia cho bạn biết vì sao. So sánh chúng chỉ dựa trên chất lượng thì bạn chẳng học được gì, vì các đầu ra không thể so sánh tương đương — và các nhà cung cấp chưa từng đánh giá chúng đối đầu nhau. So sánh chúng dựa trên những gì một lệnh gọi thực sự trả về, chi phí ra sao, và mỗi cái hết đường ở đâu, thì cặp đôi này trở thành một phép kiểm tra ranh giới thực sự hữu ích.

Hai hợp đồng đầu ra khác nhau

Sự khác biệt làm nên tất cả ở đây là những gì quay trở lại trên đường truyền.

Liquid AI d1-3B trả về một đối tượng câu trả lời có cấu trúc. Mỗi câu hỏi trong một yêu cầu đều khai báo một loại — noul cho dạng có/không với P(có), choice cho một lựa chọn trong tập tùy chọn được đặt tên kèm độ tin cậy và xác suất cho từng tùy chọn, hoặc score cho một vị trí trên thang có thứ tự từ hai đến mười mức với mức dự kiến và phân phối của nó. Mô hình báo cáo output_tokens: 0 vì không có gì được ghi ra. Nhiều câu hỏi trên cùng một trạng thái được đọc từ một lượt lan truyền xuôi duy nhất, và trạng thái cùng các hình ảnh của nó được mã hóa một lần cho tất cả chúng.

Ge​mma 4 12B trả về văn xuôi. Đôi khi nó trả về JSON bạn yêu cầu, đôi khi nó trả về JSON không hẳn như bạn yêu cầu, và nó có thể suy luận trước khi trả lời. Xét cho cùng nó là một mô hình ngôn ngữ: bất cứ thứ gì nó biết cách phân loại, nó đều thể hiện dưới dạng văn bản. Đó là một điểm mạnh khi câu trả lời phải được giải thích cho con người hoặc được đưa vào một bước tiếp theo vốn mong đợi ngôn ngữ, và là một chi phí khi thứ duy nhất bạn cần chỉ là một con số.

Mọi thứ ở hạ nguồn đều suy ra từ đó. Một phản hồi d1-3B chắc chắn phân tích cú pháp được. Nó cũng không thể tự giải thích, và thẻ mô hình nói thẳng điều đó: nó không phải là mô hình trò chuyện và nó không viết văn bản.

Tình trạng các dấu vết bằng chứng hiện nay

Nguồn gốc của hai bộ số liệu không tương đương, và ở đây điều đó còn quan trọng hơn cả bản thân những con số.

• Decision Index 0.2.1 — Liquid AI d1-3B đạt 48.57 điểm, được nhà cung cấp chấm bằng công cụ chấm điểm chính thức, đứng đầu trong số các mô hình dưới 10B và vượt qua Decider 35B-A3B ở mức 47.11. Ge​mma 4 12B hoàn toàn không được chấm điểm trên Decision Index, vì vậy dòng này không có mục tương ứng.

• Các benchmark suy luận — Ge​mma 4 12B đạt 77,5 trên AIME 2026, 78,8 trên GPQA Diamond và 1.659 ELO Codeforces, đồng thời có Artificial Analysis Intelligence Index là 22 ở chế độ suy luận và 13 khi tắt suy luận. Liquid AI d1-3B không có benchmark suy luận, vì mô hình quyết định không tạo ra dấu vết suy luận để chấm điểm.

• Ngữ cảnh dài — Ge​mma 4 12B chấp nhận 256.000 token và đạt 43,4% trên MRCR v2 eight-needle ở 128k trên card của chính Goo​gle. Liquid AI d1-3B chấp nhận 32.768 token. Nếu "trạng thái" của bạn là một tài liệu bốn mươi trang cộng với các bản scan, thì khoảng cách đó chính là toàn bộ quyết định và nó không hề sát nút.

• Thị giác — Liquid AI d1-3B đạt trung bình 74,1 trên mười một benchmark hình ảnh công khai, được đọc như các quyết định trên tập lựa chọn của từng benchmark, so với 73,9 của backbone LFM2.5-VL-3B mà nó được xây dựng từ đó, và nhà cung cấp báo cáo rằng việc loại bỏ hình ảnh làm giảm cùng những câu hỏi đó xuống 45,1. Thị giác của Ge​mma 4 12B mạnh hơn và rộng hơn, nhưng nó được báo cáo như chất lượng tạo sinh, không phải độ chính xác quyết định trên các lựa chọn được nêu tên.

• Ngôn ngữ — mười sáu ngôn ngữ được ghi nhận cho Liquid AI d1-3B; hơn 140 cho Gemma 4 12B.

• Tốc độ — Liquid AI d1-3B trả lời một câu hỏi trong 8 ms trên RTX 4090, 16 ms trên Jetson AGX Thor, 26 ms trên Jetson AGX Orin 64 GB và 50 ms trên Jetson Orin Nano, đồng thời đóng gói 64 trạng thái vào một lượt chạy duy nhất với tốc độ 475 lượt mỗi giây trên 4090. Gemma 4 12B tạo sinh, nên độ trễ của nó phụ thuộc vào số token mà nó viết ra.

• Chất lượng bằng chứng — Kết quả của Gemma 4 12B là của Google, được công bố vào tháng 6 năm 2026 và kể từ đó đã được một cộng đồng lớn mổ xẻ, lượng tử hóa và chạy lại. Còn kết quả của Liquid AI d1-3B là của Liquid, được công bố cách đây hai ngày, chưa được ai ngoài phòng thí nghiệm tái lập. Hãy đọc cột thứ hai cho phù hợp.

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

Nơi duy nhất họ thực sự cạnh tranh

Có một sự trùng lặp thực sự, và nó không nằm trên bảng xếp hạng. Đó chính là lệnh gọi LLM-as-a-judge.

Nhiều pipeline sản xuất đã sử dụng một mô hình đa năng cỡ trung làm lớp đánh giá: chấm điểm mức độ khẩn cấp của ticket này, quyết định liệu đầu ra này có đạt một bộ tiêu chí hay không, chọn công cụ mà agent nên gọi tiếp theo, kiểm tra liệu một đoạn được truy xuất có trả lời câu hỏi hay không. Ngày nay, hầu hết những lệnh gọi đó đều được gửi đến một mô hình sinh, vốn được yêu cầu xuất ra một con số hoặc một nhãn dưới dạng văn bản, và con số mà nó xuất ra là bất cứ thứ gì bộ lấy mẫu tạo ra chứ không phải một softmax trên tập lựa chọn của bạn. Đó chính là quy trình mà Liquid AI d1-3B được huấn luyện hậu kỳ để thay thế, và các bản demo đã công bố đều là những phiên bản của nó — một vị từ SQL trả lời có hoặc không cho 150 ticket hỗ trợ, một vòng lặp nén ngữ cảnh của agent, vốn giữ, cắt bớt hoặc loại bỏ từng đầu ra của công cụ và loại bỏ 52% token, một ứng dụng kiểm tra thị giác phân loại chi tiết tốt và chi tiết lỗi từ bốn dây chuyền sản xuất với độ chính xác từ 85 đến 97% trên một tác vụ mà nó chưa từng được huấn luyện.

Gemma 4 12B làm tất cả những công việc đó, và còn làm được nhiều hơn thế. Nó cũng có thể viết bản tóm tắt, giữ một tài liệu 256K trong tầm xem, nhận một cuộc gọi điện thoại đã ghi âm làm đầu vào, và trả lời bằng một trong hơn 140 ngôn ngữ. Nếu pipeline của bạn cần một đánh giá và một bản tường thuật, thì 12B đang làm hai việc chỉ với một lần gọi và mô hình quyết định 3B đang làm một trong số đó.

Ranh giới nằm ở độ dài ngữ cảnh và dạng đầu ra. Trạng thái dài, đầu vào dạng nói, nhiều ngôn ngữ, hay một lời giải thích mà người đọc mong đợi — Ge​mma 4 12B, không phải bàn cãi. Trạng thái ngắn, một tập tùy chọn cố định, ngân sách độ trễ cho mỗi yêu cầu chỉ ở mức một chữ số mili giây, hay một bảo đảm chắc chắn rằng câu trả lời sẽ phân tích được — đó là cột d1-3B, và mô hình tổng quát đang phải trả giá cho năng lực mà bạn sẽ không dùng đến.

Mỗi cái tốn bao nhiêu để gọi

Cả hai mô hình đều không có trong danh mục của chúng tôi, nên không có giá định tuyến nào để báo cho mô hình nào — Gemma 4 12B không thuộc các kích cỡ Gemma mà chúng tôi phục vụ, còn Liquid AI d1-3B là trọng số mở mà bạn tự lưu trữ hoặc truy cập qua API riêng của nhà cung cấp và các nền tảng bên thứ ba. Để có thông tin tham khảo về phía gần Gemini của dòng họ đó, hai kích cỡ Gemma 4 mà chúng tôi định tuyến được niêm yết ở mức $0.06 mỗi triệu đầu vào và $0.33 mỗi triệu đầu ra đối với Gemma 4 26B A4B, cùng $0.13 và $0.38 đối với Gemma 4 31B, cả hai đều có ngữ cảnh 262.144 token và đầu vào văn bản, hình ảnh, video. Mức giá trung vị của nhà cung cấp được báo cho Gemma 4 12B ở nơi khác nằm quanh $0.10 và $0.30.

chạy trên hạ tầng của Liquidd1 chỉ tính phí token đầu vào, ở mức $0.04 mỗi triệu, với hình ảnh được tính là đầu vào ở 1,5 token cho mỗi patch 32×32 pixel. Do đó, một yêu cầu quyết định hoàn toàn không có dòng token đầu ra, và đó là lý do mang tính cấu trúc khiến so sánh chi phí của chính nhà cung cấp với các mô hình lớn hơn nhiều lại cho ra kết quả như vậy. Trọng số mở không có giá theo lượt gọi; bạn trả bằng phần cứng. Cả hai đều phải nằm trong cùng một pipeline như mọi thứ khác bạn gọi, đó là lớp mà một router tồn tại để giải quyết — một API xuyên suốt hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển tiếp với mức markup 0%, và chuyển đổi dự phòng tự động để một trục trặc nhỏ từ phía thượng nguồn không trở thành sự cố ngừng dịch vụ của bạn. Đó là hệ thống đường ống xung quanh phép so sánh, chứ không phải bản thân phép so sánh.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Làm thế nào để quyết định, thành thật mà nói

Hãy bắt đầu từ định dạng câu trả lời thay vì từ mô hình. Nếu hệ thống hạ nguồn có thể tiêu thụ một xác suất, một nhãn và một độ tin cậy, đồng thời tập câu trả lời nhỏ và đã biết, thì Liquid AI d1-3B không phải là bản hạ cấp so với 12B — đó là một công cụ khác, và các con số độ trễ khiến nó trở thành một kiểu triển khai khác hẳn về bản chất: 50 ms trên một Jetson Orin Nano là thiết bị không có cửa nào để chạy 12B cả.

Nếu câu trả lời bắt buộc phải là một câu, hoặc trạng thái dài hơn ba mươi hai nghìn token, hoặc ai đó sẽ nói nó thành tiếng, hoặc ngôn ngữ đầu ra là tiếng Bengal, thì Ge​mma 4 12B là mô hình duy nhất trong hai mô hình có thể làm được việc đó và cuộc so sánh kết thúc trước khi nó bắt đầu.

Vị trí thực sự hữu ích đối với hầu hết các đội là cả hai, ở những chỗ khác nhau. Một mô hình ra quyết định đứng trước lệnh gọi đắt đỏ, làm việc phân loại, định tuyến và kiểm tra rào chắn không cần đến ngôn ngữ; một mô hình tổng quát đứng sau nó cho công việc cần đến ngôn ngữ. Đó là cùng một pipeline, một cái là bộ lọc và một cái là payload — và những đội sẽ khai thác được nhiều nhất từ bản phát hành d1 chính là những đội đang phải trả giá bằng một 12B để trả lời có hoặc không.

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.