
Liquid AI d1-3B so với Intern-Decision-4B: Bạn thực sự cần Bộ quyết định đã hiệu chỉnh nào?
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Hai mô hình trọng số mở giờ trả lời câu hỏi bằng cách không viết gì cả, và cho đến khi bạn đặt lược đồ I/O của chúng cạnh nhau, chúng trông cứ như cùng một ý tưởng lặp lại hai lần. Liquid AI d1-3B, được tải lên Hugging Face ngày 5 tháng 10 năm 2026 và được Liquid công bố hai ngày sau đó, là một mô hình quyết định đa phương thức 3,12B mà card của nó nói thẳng rằng nó "không phải mô hình chat và không viết văn bản." Intern-Decision-4B của InternLM, được âm thầm tải lên tổ chức InternLM vào ngày 26 tháng 9 năm 2026 mà không có bài blog, không tweet và không có trang ra mắt nào phía sau, là một mô hình quyết định 4B được tinh chỉnh từ Qwen3.5-4B, cũng trả về một phân phối câu trả lời cho mọi câu hỏi trong một lượt lan truyền xuôi. Bề ngoài thì cùng một hợp đồng. Những khác biệt bên dưới — một giấy phép sẽ khiến bạn rắc rối, một hợp đồng có thể vô tình viết ra văn bản, và những cỗ máy chưa ai so sánh — mới là thứ quyết định cái nào thuộc về stack của bạn.
Cả hai thực sự gần nhau đến mức nào
Điều đầu tiên rút ra là so sánh này hòa nhau ở mức nào. Cả hai mô hình đều nhận một trạng thái và một lược đồ gồm các câu hỏi có tên; cả hai đều đọc tín hiệu từ log tại một vị trí thay vì lấy mẫu; cả hai đều đa phương thức; và cả hai đều báo cáo rằng chúng không viết gì. Về hình dạng của lệnh gọi, chúng gần như giống hệt nhau, và những khác biệt thú vị nằm ở các chi tiết quanh rìa.
• Kích thước — Liquid AI d1-3B tổng 3,12B, được xây dựng trên LFM2.5-VL-3B của Liquid; Intern-Decision-4B 4B (khoảng 4,54B theo số lượng tensor mà thẻ mô hình in ra), được tinh chỉnh từ Qwen3.5-4B
• Các loại câu hỏi — d1-3B và Intern-Decision-4B dùng cùng ba loại: noul cho có/không, choice cho một lựa chọn trong tập hợp được đặt tên, score cho một điểm trên thang đo có thứ tự
• Các trường trả lời — d1-3B trả về câu trả lời cùng với độ tin cậy và Intern... các phân phối cùng với một giá trị độ tin cậy mà thẻ mô hình cảnh báo là không được hiệu chỉnh
• Giới hạn đầu vào — d1-3B 32.768 token ngữ cảnh; Intern-Decision-4B mức trần 8.192 token, từ chối dứt khoát các yêu cầu dài hơn thay vì cắt bớt, với hình ảnh cũng được tính vào mức trần đó
• Giấy phép — d1-3B theo LFM Open License v1.0 của Liquid, Apache 2.0 ở phía InternLM
• Ngôn ngữ — d1-3B liệt kê 16; thẻ của Intern-Decision-4B ghi không có
• Giao diện — d1-3B được cung cấp dưới dạng một mô hình mà bạn tải và gọi bằng trust_remote_code=True; Intern-Decision-4B được cung cấp dưới dạng một thư viện Python mà bạn pip install, với một backend đã triển khai và trường của chính yêu cầu model rõ ràng không thể chuyển đổi checkpoint
• Điểm số của chính các nhà cung cấp — d1-3B 48,57 trên Decision Index 0.2.1 public split; Intern-Decision-4B 90,02 tính trung bình trên bảng bảy tập của chính nó với điểm Brier là 0,347 và sai số hiệu chuẩn kỳ vọng là 0,065
Hai con số cuối cùng đó không thể so sánh được, và coi chúng như một bảng điểm sẽ là sai lầm dễ mắc nhất trên trang này. Chúng đến từ những harness khác nhau, những bộ câu hỏi khác nhau và những bộ chấm điểm khác nhau.

Hiệu chuẩn chính là toàn bộ sản phẩm, và chỉ một trong số họ đứng ra bảo đảm điều đó bằng văn bản.
Một mô hình ra quyết định chỉ đáng với độ trễ của nó nếu con số mà nó trả về bên cạnh câu trả lời có ý nghĩa. Đó chính là hiệu chuẩn: độ tin cậy được nêu là 0,9 phải đúng khoảng chín lần trong mười lần, và một mô hình tự tin nhưng sai thì tệ hơn một mô hình nói rằng nó không biết.
InternLM là bên thực sự đề cập đến vấn đề này. Thẻ mô hình của nó ghi lại nhiệt độ đã khớp là 1.99241824, thu được bằng cách tối thiểu hóa log-likelihood âm trên 1.728 trường hợp hiệu chuẩn được chỉ định, với 1.693 trường hợp được giữ lại để kiểm định, và được in đến tám chữ số thập phân để có thể tái tạo. Nó cũng công bố một thử nghiệm thí điểm trước–sau trên 96 trường hợp cho thấy cơ chế này đang hoạt động thay vì chỉ khẳng định suông: Brier 0.628 và ECE 0.213 trước hiệu chuẩn, so với 0.550 và 0.089 sau đó. Brier và ECE là hai thước đo tiêu chuẩn để đánh giá liệu các xác suất được nêu có trung thực hay không, và mức dịch chuyển là rất lớn.
Liquid không công bố sản phẩm tương đương nào. Thẻ thông số của chính d1-3B mang các chỉ số chuẩn thuộc dạng độ chính xác — SQuAD 2.0 85.3, Civil Comments 93.0, MASSIVE intent 87.3, PubMedQA 66.0, BoolQ 86.7, XNLI 85.0, PAWS-X 76.9, trung bình 77.1 — cùng với 48.57 trên Decision Index, và điểm bán hàng được nêu của mô hình là các câu trả lời có kiểu dữ liệu đã được hiệu chỉnh. Nhưng không có hàng ECE, không có hàng Brier, và không có nhiệt độ được fit nào được công bố.
Sự bất đối xứng đó không có nghĩa là hậu duệ của Qwen3.5-4B được hiệu chỉnh tốt hơn một mô hình 3B dựng trên LFM2.5-VL-3B; nó có nghĩa là giữa hai thẻ này, một thẻ cho bạn phép tính để tái lập tuyên bố còn thẻ kia chỉ cho bạn tuyên bố. Nếu pipeline của bạn đặt ngưỡng trên một độ tin cậy — định tuyến khi trên 0.8, chuyển lên xử lý cao hơn khi dưới 0.4 — thì tối nay bạn có thể xác thực phía InternLM, còn phía Liquid thì bạn chỉ có thể kiểm tra nhanh.
Lời lưu ý này có ý nghĩa theo cả hai hướng. Cả hai bộ số liệu đều là dữ liệu nội bộ. Không mô hình nào được một bên độc lập chấm điểm, và những tuyên bố về hiệu chuẩn của InternLM dựa trên thí điểm 96 trường hợp của chính InternLM, đối chiếu với mô hình khớp của chính InternLM.
Giấy phép yêu cầu bạn cung cấp một con số
Intern-Decision-4B dùng Apache 2.0, kế thừa từ Qwen3.5-4B, với các thông báo thượng nguồn được giữ nguyên — sử dụng thương mại, phân phối lại, tinh chỉnh, không có vấn đề doanh thu nào ở bất cứ đâu trong đó.
d1-3B thuộc Liquid's LFM Open License v1.0, và Mục 5 là phần không ai đọc cho đến khi bộ phận thu mua đọc. Việc sử dụng thương mại chỉ được cấp phép với điều kiện bạn hoặc pháp nhân của bạn vẫn ở dưới một Ngưỡng, được định nghĩa trong cùng tài liệu đó là doanh thu hằng năm từ mười triệu đô la Mỹ trở lên; sử dụng vượt trên ngưỡng đó đơn giản là không được cấp phép. Các tổ chức phi lợi nhuận và người dùng nghiên cứu được miễn trừ.
Đối với một cá nhân hoặc một nhóm nhỏ, cả hai đều miễn phí. Đối với bất kỳ thứ gì có bộ phận tài chính, hai repo là hai sản phẩm khác nhau, và sự khác biệt nằm ở một con số mà bạn hoặc vượt qua, hoặc không.
Phần cuối trong bảng benchmark của d1-3B mới là tuyên bố thực sự của nó
Con số nổi bật trên thẻ mô hình của Liquid là 48,57 trên Decision Index 0.2.1, dẫn trước các dòng dưới 10B khác trong một bảng chạy từ Winnow-12B ở 50,02 xuống Decider 2B ở 28,97. Điều khiến con số đó đáng để trích dẫn là chỉ số phân biệt nằm bên dưới nó. Trên các điểm thành phần của chính Decision Index, d1-3B đạt 74,5 ở Tools và 36,3 ở Arts trong khi chỉ đạt 23,8 ở Knowledge — so với Decider 35B-A3B, một mô hình mixture-of-experts 36B lớn gấp 12 lần kích thước của nó, mô hình này đạt 56,5 ở Tools, 32,6 ở Arts và 31,8 ở Knowledge.

Nói cách khác, 3B không phải là một mô hình nhỏ yếu hơn một chút một cách đồng đều. Đó là một mô hình nhỏ đặc biệt mạnh ở các quyết định có cấu trúc kiểu công cụ và đặc biệt yếu ở những câu hỏi cần kiến thức thế giới, và nó đánh bại 36B ở hai hạng mục giống nhất với công việc mà nó được xây dựng để làm. Nếu quyết định của bạn là "hành động nào trong năm hành động được đặt tên này" và "điều này có căn cứ trong đoạn văn bản được truy xuất hay không", thì khoảng cách về kích thước đang đóng vai trò ít hơn bạn tưởng. Nếu quyết định của bạn dựa vào những sự kiện mà mô hình buộc phải đã nắm sẵn, hãy mong đợi 23.8 xuất hiện.
Có một phiên bản thứ hai của lập luận đó ở phía thị giác. d1-3B đạt trung bình 74,1 trên mười một benchmark hình ảnh công khai, so với 73,9 của mô hình gốc của chính nó, và khi loại bỏ hình ảnh, chính những câu hỏi đó chỉ đạt 45,1 — vì vậy, với các câu hỏi hình ảnh, câu trả lời thực sự đến từ bức ảnh. Nó ngang bằng với mô hình gốc chứ không tốt hơn, và các dòng theo từng benchmark cho thấy cả hai mặt: CV-Bench 82,1 so với 87,6, POPE 88,5 so với 90,1, BLINK 59,2 so với 58,7.
Cũng đáng lưu ý về sự tạm dừng trong thẻ InternLM: điểm tổng hợp cao của nó đến từ các tác vụ định hướng theo câu hỏi như Typed Decision 80.55 và ToolACE 96.45, trong khi Jevbench-Hard ở mức 73.87. Khi schema trở nên khó, điểm số tụt giảm.
Tốc độ: khoảng cách không nằm ở nơi bạn nghĩ.
d1-3B quảng cáo 8 ms cho một câu hỏi trên RTX 4090 và 9 ms trên MI325X, 21 ms cho ba câu hỏi dùng chung một trạng thái, 16 ms trên Jetson AGX Thor, và thông lượng gộp 475 quyết định mỗi giây trên 4090 và 1.106 trên MI325X.
Thẻ của Intern-Decision-4B đo được trung bình 44,16 ms end-to-end trên cùng một RTX 4090, với trung vị 44,03 ms và 44,60 ms ở P95.
Điều đó trông giống như một chiến thắng gấp 5 lần, nhưng không phải vậy, bởi vì cả hai đang đo những thứ khác nhau. Các con số của Liquid là các lệnh gọi mô hình ở trạng thái warm, mỗi lần một yêu cầu, với việc chọn kernel và biên dịch được trả trước — trang thông số nói rõ rằng một câu hỏi đơn lẻ tốn 16 ms trên 4090 khi không biên dịch CUDA graph, và rằng lệnh gọi đầu tiên với một shape mới phải trả chi phí biên dịch. Con số 44 ms của InternLM là end-to-end cho mỗi truy vấn thông qua một thư viện Python mà backend duy nhất được triển khai là suy luận Hugging Face cục bộ, nên nó mang theo toàn bộ cỗ máy xung quanh. Cả hai con số đều không sai. Đặt cả hai vào cùng một harness, trên cùng một máy, với cùng một dạng yêu cầu, thì khoảng cách sẽ thu hẹp thành một thứ mà bạn muốn đo đạc chứ không phải giả định.
Điều không còn phải bàn cãi là mức trần. 8,192 token là một sự từ chối cứng ở phía InternLM, và token hình ảnh cũng tiêu từ cùng ngân sách đó, nên một tài liệu dài cộng với một ảnh chụp màn hình là một yêu cầu bị trả về dưới dạng bị từ chối thay vì bị cắt ngắn. d1-3B cho bạn 32,768 token để làm việc. Nếu trạng thái của bạn là các ticket và những trao đổi ngắn, khoảng cách đó không bao giờ thành vấn đề. Nếu chúng có kích cỡ một trang, nó quyết định câu hỏi trước cả bất kỳ benchmark nào.
Chạy chúng dưới dạng một bảng điều khiển, không phải hoán đổi
Trả lời một câu hỏi có/không cụ thể và trả lời "đây là thứ nào trong sáu thứ được nêu tên, và bạn chắc chắn đến mức nào" là những yêu cầu khác nhau, và hai thẻ này có hình dạng khác nhau đủ đến mức — một cái có trần đầu vào cứng và khớp hiệu chuẩn đã công bố, cái kia có 32K ngữ cảnh và đuôi tính điểm tốt hơn — đến nỗi cách triển khai hữu ích cho một nhóm đang đánh giá cả hai thường không phải là sự thay thế mà là một hội đồng: cùng một trạng thái được đặt cho cả hai mô hình, với các bất đồng được chuyển cho con người hoặc cho một mô hình lớn hơn.
Cả hai mô hình đều không có trong danh mục của chúng tôi, và đây không phải là tuyên bố về tính sẵn có; cả hai đều là những sản phẩm tự vận hành. Nhưng một hội đồng mô hình chính là dạng bài toán mà ở đó lớp định tuyến đảm nhiệm công việc thay vì giấy tờ. OrcaRouter cung cấp hơn 200 mô hình sau một API key duy nhất với giá niêm yết của nhà cung cấp được chuyển nguyên vẹn với mức chênh lệch 0% — vì vậy khi một nhà cung cấp mà bạn định tuyến qua chúng tôi cắt giảm giá, hóa đơn của bạn cũng thay đổi ngay trong ngày — và chuyển đổi dự phòng tự động giữa các nhà cung cấp ngăn một hội đồng hai mô hình trở thành hai điểm lỗi đơn lẻ. Những mô hình bạn định tuyến hôm nay không phải hai mô hình này; chúng là những mô hình tổng quát được lưu trữ mà bạn sẽ thay thế, chẳng hạn như Qwen3.5-27B với giá $0.086 cho mỗi triệu token đầu vào và $0.688 cho mỗi triệu token đầu ra, đó là con số mà một mô hình 3B tự vận hành phải vượt qua một khi bạn đã tính đến chi phí GPU.
Việc cần làm trong tuần này
Nếu các quyết định của bạn là các trạng thái ngắn, giấy phép phải vượt qua được vòng xét duyệt của công ty bạn, và bạn muốn phạm vi mục tiêu build rộng nhất — llama.cpp, Ollama, LM Studio, một đường batch đóng gói chạy 64 trạng thái trong một lượt — thì d1-3B là cái được sản phẩm hóa hơn trong hai, và khả năng phân biệt công cụ và nghệ thuật của nó là thứ mạnh nhất mà một trong hai card thể hiện. Nếu các quyết định của bạn kéo dài qua các trạng thái dài, hoặc bạn cần một giấy phép không có điều khoản doanh thu, hoặc bạn muốn một phép khớp hiệu chuẩn mà bạn có thể tái lập và một harness nơi chi phí xung quanh đã được tính sẵn, thì Intern-Decision-4B là cái có hồ sơ giấy tờ mà bạn thực sự có thể kiểm tra.

Phần gây khó chịu thì giống nhau ở cả hai: chưa có bên độc lập nào từng chạy bất kỳ mô hình nào trong hai mô hình đó, và không tồn tại phép so sánh hiệu chuẩn nào mà lại không do nhà cung cấp đã viết thẻ đó đặt hàng. Với một lớp mô hình mà toàn bộ giá trị của nó nằm ở ý nghĩa của một con số bên cạnh một câu trả lời, đó chính là khoảng trống đáng để lấp đầy trước khi bạn đặt ngưỡng cho bất cứ thứ gì.
