
Liquid AI d1-3B so với Granite 4.2 3B: Hai mô hình 3B không bao giờ làm cùng một việc
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Đặt Liquid AI d1-3B và Granite 4.2 3B trên cùng một GPU duy nhất thì cả hai đều vừa vặn thoải mái — 3,12B tham số ở một bên, 3B ở bên kia. Chúng cũng sẽ hành xử như thể đến từ những lĩnh vực khác nhau. Granite 4.2 3B, mà thẻ mô hình của chính IBM ghi ngày 25 tháng 8 năm 2026, là một mô hình suy luận: ba chế độ suy nghĩ, một <think> khối, và một câu trả lời mà bạn đọc. Liquid AI d1-3B, được tải lên Hugging Face vào ngày 5 tháng 10 năm 2026 và được Liquid công bố hai ngày sau đó, là một mô hình quyết định: nó nhận một trạng thái cùng một tập hợp rõ ràng gồm các câu hỏi có kiểu và trả về một xác suất, một nhãn hoặc một vị trí trên thang đo trong một lượt truyền xuôi, báo cáo output_tokens: 0 vì nó không bao giờ viết ra gì cả. Câu hỏi hữu ích không phải là cái nào tốt hơn. Mà là lệnh gọi nào trong số các lệnh gọi của bạn thực sự là một quyết định, bởi vì hai repo được xây dựng cho hai nửa đối lập của sự phân tách đó.
Thực sự có gì trong mỗi kho lưu trữ?
Mọi thứ dưới đây đều đến từ hai thẻ mô hình và bài đăng công bố của Liquid. Không có nội dung nào ở đây được tái tạo độc lập, không bên thứ ba nào chấm điểm mô hình nào trong hai mô hình trên cùng một harness, và các con số trong các thẻ là của chính các nhà cung cấp.
• Kích thước — Liquid AI d1-3B tổng 3,12B, được xây dựng trên LFM2.5-VL-3B của Liquid; Granite 4.2 3B là một transformer dày đặc chỉ-giải-mã 3B được xây dựng trên granite-4.1-3b-base
• Đầu ra — d1-3B trả về xác suất, nhãn và độ tin cậy và không viết văn bản nào cả; Granite 4.2 3B sinh token, bao gồm một chuỗi suy luận tùy chọn bên trong<think> thẻ
• Ngữ cảnh — d1-3B 32.768 token; Granite 4.2 3B 128K nguyên bản, với khả năng mở rộng ngữ cảnh dài lên 512K trên card
• Đầu vào — văn bản, JSON, hình ảnh d1-3B hoặc hỗn hợp, thông qua bộ mã hóa thị giác SigLIP2 NaFlex 400M; Granite 4.2 3B chỉ văn bản
• Giấy phép — d1-3B theo Giấy phép Mở LFM của Liquid v1.0; Granite 4.2 3B theo 2.0
• Ngôn ngữ — d1-3B liệt kê 16; Granite 4.2 3B liệt kê mười hai mục đã được kiểm thử, với thẻ ghi chú rằng những mục khác chưa được kiểm thử
• Phục vụ — d1-3B cung cấp mã tùy chỉnh (trust_remote_code=True, transformers>=5.14), với các repo GGUF và w8a8 trong cùng họ và các card được ghi tài liệu cho llama.cpp, Ollama và LM Studio; Granite 4.2 3B chạy trên vLLM 0.20+ hoặc SGLang 0.5.18+ với một bộ phân tích thinking tùy chỉnh
Hai trong số những dòng đó gánh vác nhiều hơn phần còn lại. Dòng output chính là toàn bộ luận điểm của bài viết này, còn dòng giấy phép là dòng mà không ai đưa vào bảng so sánh.

Một bên viết một chuỗi suy nghĩ, bên kia từ chối viết.
Granite 4.2 3B chứng tỏ giá trị của mình bằng cách suy nghĩ thành tiếng. Thẻ của nó ghi lại ba chế độ: suy nghĩ bật theo mặc định, không suy nghĩ, và chế độ nỗ lực thấp giữ lại dấu vết lý luận nhưng rút ngắn nó. Các ngăn xếp phục vụ tách dấu vết khỏi câu trả lời cuối cùng để ứng dụng của bạn nhận được nội dung sạch cùng với một trường lý luận riêng. Đó là một thiết kế tốt cho một câu hỏi cần được giải quyết — một bài toán, một nhánh logic, một đoạn mã phải được viết trước khi có thể đánh giá.
d1-3B không có chế độ như vậy, và thẻ của nó nói thẳng thừng: "Nó không phải là mô hình trò chuyện và không viết văn bản." Một lệnh gọi khai báo các câu hỏi với một kiểu. noul là dạng có/không, trả về P(có) trong khoảng từ 0 đến 1. choice chọn một nhãn từ một tập tùy chọn có tên và trả về nhãn, độ tin cậy và xác suất cho mỗi tùy chọn. score đặt trạng thái trên một thang đo có thứ tự từ hai đến mười và trả về mức kỳ vọng cùng với phân phối và chú giải của nó. Tín hiệu được đọc từ logits tại một vị trí giữ chỗ trong một lượt, không lấy mẫu từng token một, đó là lý do khối sử dụng có thể báo cáo không có token đầu ra mà không nói dối.
Sự khác biệt đó thay đổi hóa đơn của bạn trước khi nó thay đổi độ chính xác của bạn. Một lệnh gọi phân loại Granite suy nghĩ trong 400 token là một lệnh gọi mà bạn phải trả cho 400 token đầu ra, và nhãn bạn muốn bị chôn trong phần văn xuôi mà sau đó một trình phân tích cú pháp phải trích xuất. Một lệnh gọi d1-3B chỉ tính phí đầu vào. Nếu phần lớn lưu lượng của bạn là một nhãn gắn với một quy tắc, bạn đã phải trả tiền cho phần suy luận dù nó có làm thay đổi nhãn hay không.
Khi Granite 4.2 3B rõ ràng là lựa chọn tốt hơn
Cứ chấp nhận các benchmark suy luận như đúng như công bố — chúng là của chính IBM, chạy qua pipeline NeMo Evaluator nội bộ, và chưa có bên ngoài nào tái lập được — thì mô hình 3B mạnh một cách bất thường so với kích thước của nó: AIME25 78.33, HMMT tháng 2 năm 2025 66.67, GPQA 54.80, LiveCodeBench v6 69.71, MMLU-Pro 67.84, IFBench 74.33, BFCL v4 52.41, tau3-bench 45.78, và RULER 64K 67.52 giảm còn 55.30 ở 128K.
Từ danh sách đó suy ra bốn công việc, và d1-3B không nằm trong bất kỳ công việc nào trong số đó.
• Ngữ cảnh gốc 128K, có thể mở rộng lên 512K, so với 32,768 token trên d1-3B — nếu trạng thái của bạn là một tài liệu dài, lựa chọn đã được định sẵn cho bạn
• Gọi công cụ kiểu tác tử với parser được tài liệu hóa và các tích hợp harness cho OpenCode, Pi và OpenHands, điều mà một mô hình ra quyết định không có tương đương.
• Bất kỳ nhiệm vụ nào có câu trả lời là một đoạn văn: tóm tắt, soạn thảo, trích xuất thành cấu trúc dạng tự do, tạo mã
• Tinh chỉnh và phân phối lại không có mức trần doanh thu, vì Apache 2.0 không có điều khoản ngưỡng
Hãy lưu ý điều không có trên thẻ Granite: các hàng SWE-Bench và Terminal-Bench được đánh dấu NA đối với mô hình 3B. Giai đoạn học tăng cường dạng tác tử của IBM chỉ được áp dụng cho các thành viên 8B và 30B của dòng mô hình, vì vậy mô hình nhỏ nhất không mang các điểm số tác tử như các mô hình anh em lớn hơn. Một nhóm đọc "Granite 4.2" và cho rằng 3B thừa hưởng hồ sơ tác tử của cả dòng sẽ bị bất ngờ.

Nơi d1-3B giành chiến thắng trước khi Granite nghĩ xong
Bảng độ trễ của chính Liquid, được đo ở trạng thái nóng, mỗi lần một yêu cầu, là phần mạnh nhất trong lập luận của nó: một câu hỏi đơn lẻ trong 8 ms trên RTX 4090 và 9 ms trên AMD MI325X, 16 ms trên Jetson AGX Thor và 26 ms trên Jetson AGX Orin 64GB, với 64 trạng thái được đóng gói trong một lượt chạy ở tốc độ 475/s trên 4090 và 1,106/s trên MI325X. Để so sánh, đó gần bằng thời gian Granite 4.2 3B cần để phát ra một vài token trong dấu vết suy luận của nó.
Ba loại câu hỏi trên một trạng thái khiến d1-3B tốn 21 ms trên 4090 thay vì ba lệnh gọi riêng biệt, vì trạng thái và các hình ảnh của nó được đọc một lần cho tất cả câu hỏi. Trong một ngăn xếp kiểm duyệt hoặc an toàn vốn từng gửi một yêu cầu HTTP cho mỗi quy tắc, đó là sự khác biệt giữa một hàng đợi các lệnh gọi và một lệnh gọi.
Nó cũng nhìn thấy. d1-3B đạt điểm trung bình 74,1 trên mười một bộ đánh giá hình ảnh công khai, so với 73,9 của mô hình cơ sở, và thẻ mô hình lưu ý rằng khi loại bỏ hình ảnh, cùng những câu hỏi đó chỉ đạt 45,1 — câu trả lời đến từ hình ảnh, chứ không phải từ lời nhắc văn bản. Các hàng riêng lẻ cho kết quả theo cả hai hướng (CV-Bench 82,1 so với 87,6 của mô hình cơ sở, POPE 88,5 so với 90,1), vì vậy tuyên bố về thị giác là "ngang bằng với mô hình cơ sở", chứ không phải "tốt hơn nó".
Đối trọng trung thực: mức 48,57 của d1-3B trên Decision Index 0.2.1 được tạo ra bởi việc Liquid tự chạy bộ chấm điểm chính thức, thay vì qua một bài nộp lên bảng xếp hạng, và các hàng đối thủ đến từ bảng xếp hạng công khai. Mức trung bình 77,1 của nó trên tám tác vụ benchmark-as-decision và mức 71,8 trên DecisionBench cũng đều do chính bên thứ nhất tạo ra. Mọi thứ ở phía d1 trong so sánh này đều chưa được xác minh.

Tại sao một mô hình suy luận 3B không phải là một mô hình ra quyết định 3B
Việc dễ làm theo bản năng là coi Granite 4.2 3B như một lựa chọn thay thế rẻ hơn cho d1-3B, hoặc ngược lại. Cả hai đều thất bại, và sự thất bại này mang tính cấu trúc chứ không phải là vấn đề chất lượng.
Yêu cầu Granite quyết định và bạn nhận được một kết quả sinh mà bạn phải phân tích cú pháp, một hóa đơn tăng theo độ khó mà mô hình cảm nhận về câu hỏi, và độ trễ phụ thuộc vào chế độ suy nghĩ bạn đã chọn. Yêu cầu d1-3B suy luận và bạn chẳng nhận được gì cả — nó không có luồng token nào để suy luận. Hai mô hình nằm ở hai phía đối lập của một ranh giới mà hầu hết các pipeline vượt qua vài lần mỗi yêu cầu: thứ gì đó phải quyết định, và thứ gì đó phải nói. d1-3B thuộc về vị trí phía trước, nơi một quy tắc phân loại chọn tuyến đường và trả về độ tin cậy đã hiệu chỉnh. Granite 4.2 3B thuộc về phía sau nó, trên nhánh cần một câu trả lời được viết ra.
Có một cái bẫy thứ hai, âm thầm hơn. Giá trị của một mô hình ra quyết định nằm ở độ hiệu chuẩn — một độ tin cậy 0,9 mà đúng chín lần trong mười. Thẻ của Granite 4.2 3B không công bố chỉ số hiệu chuẩn nào và không có xác suất; nó công bố điểm độ chính xác và điểm suy luận. So sánh hai mô hình trên bảng xếp hạng đánh giá chuẩn chẳng cho bạn biết điều gì về việc nên tin cậy mô hình nào để áp dụng một ngưỡng.
Dòng giấy phép mà không ai đưa vào bảng
Granite 4.2 3B được phát hành theo Apache 2.0. d1-3B được phát hành theo LFM Open License v1.0, thoạt đọc có vẻ mang tính cấp phép tự do cho đến Mục 5: việc sử dụng thương mại được cấp với điều kiện bạn hoặc pháp nhân của bạn vẫn nằm dưới một ngưỡng được định nghĩa trong cùng tài liệu là doanh thu hằng năm từ mười triệu đô la Mỹ trở lên, và mọi mục đích sử dụng thương mại vượt trên ranh giới đó đơn giản là không được cấp phép. Các tổ chức phi lợi nhuận và người dùng nghiên cứu được miễn trừ.
Với một người làm sở thích hay một startup, đây không phải là vấn đề. Với một công ty vượt qua ranh giới đó giữa năm — hoặc có thể bị một công ty như vậy mua lại — hai repo không phải là những tạo tác tương đương, cho dù số lượng tham số của chúng trông giống nhau đến đâu, và việc rà soát giấy phép diễn ra rất lâu sau khi ai đó đã phát hành nguyên mẫu. Đây là thứ rẻ nhất trên trang này để kiểm tra sớm.
Chạy cặp đó như một pipeline
Không mô hình nào trong số này có trên danh mục của chúng tôi ở thời điểm hiện tại, nên đây không phải là tuyên bố về tính sẵn có: cả hai đều là sản phẩm tự lưu trữ, và Granite 4.2 3B nói riêng hoàn toàn không có nhà cung cấp suy luận nào được liệt kê trên thẻ của nó. Nhưng mô thức mà một đội ngũ thực sự rốt cuộc áp dụng là một lệnh gọi đưa ra quyết định và một lệnh gọi khác thực hiện phần nói, và chính mô thức đó là nơi một lớp định tuyến khẳng định được vị trí của mình. OrcaRouter đưa hơn 200 mô hình ra sau một khóa API duy nhất với giá niêm yết của nhà cung cấp được chuyển nguyên với mức phụ trội 0%, nên khi nhà cung cấp cắt giảm giá, hóa đơn của bạn nhận được thay đổi ngay trong ngày thay vì phải đợi đến kỳ gia hạn hợp đồng tiếp theo, và tự động chuyển đổi dự phòng giữa các nhà cung cấp nghĩa là thành phần dùng chung ở giữa một pipeline không trở thành một điểm lỗi đơn lẻ trong khi bạn vẫn đang đánh giá nó. Nếu bạn muốn A/B d1-3B với một mô hình tổng quát được lưu trữ trên lưu lượng của riêng bạn trước khi cam kết triển khai tự lưu trữ, thì mô hình láng giềng được định tuyến gần nhất với dòng dõi của Granite là Gemma 4 31B với $0.13 mỗi triệu token đầu vào và $0.38 mỗi triệu token đầu ra — một mô hình lớn hơn nhiều, nhưng vẫn giữ vai trò “mô hình tổng quát viết” trong pipeline.
Phán quyết, được nêu như một quy tắc
Nếu thứ bạn cần là một phán đoán — spam hay không, vào hàng đợi nào, khẩn cấp đến mức nào, hình ảnh này có khớp với mô tả đó không — thì d1-3B là mẫu duy nhất trong hai mẫu làm được việc đó chỉ trong một lượt, và nó làm trong vòng chưa đầy 10 mili giây. Nếu thứ bạn cần là một câu trả lời bằng văn bản, một tài liệu dài cần đọc, một lệnh gọi công cụ hay một đoạn mã, thì Granite 4.2 3B là mẫu duy nhất có luồng token, và điểm suy luận của mẫu 3B thực sự ấn tượng so với kích thước của nó — trên chính các bài đánh giá của IBM, khi chưa có ai kiểm chứng chúng.
Điều có thể thay đổi cục diện không phải là một dòng benchmark mới. Mà là việc một bên thứ ba chấm điểm cả hai mô hình trên cùng một khung hiệu chuẩn, bởi vì thuộc tính quyết định liệu bạn có thể đặt ngưỡng cho một mô hình chính là thuộc tính mà không model card nào cho bạn so sánh được ở thời điểm hiện tại.
