Một thẻ tiêu đề được tạo cho Microsoft-Decision-1 so với Liquid AI d1-3B với phụ đề 'hai mô hình quyết định duy nhất đồng thuận về cửa sổ ngữ cảnh', cùng các chip ghi 32,768 token trên cả hai, chỉ văn bản so với văn bản, hình ảnh và âm thanh, 25 ngôn ngữ so với 16, API được lưu trữ so với trọng số lfm1.0, và phần chân trang ghi chú rằng số liệu của cả hai nhà cung cấp là tự báo cáo và chưa được xác minh.
Guides & Insights

Microsoft-Decision-1 so với Liquid AI d1-3B: Cùng cửa sổ 32K, hai cách hiểu khác nhau

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Lần này thì các thông số kỹ thuật khớp nhau. Microsoft-Decision-1, đã chính thức khả dụng trên Microsoft Foundry kể từ ngày 8 tháng 10 năm 2026, có 32.768 token ngữ cảnh. Liquid AI d1-3Bcũng vậy, được tải lên Hugging Face vào ngày 5 tháng 10 năm 2026 và được Liquid AI công bố hai ngày sau đó. Cả hai đều nhận một trạng thái cùng với một tập câu hỏi có kiểu — có/không, lựa chọn giữa các phương án được nêu tên, một vị trí trên một thang đo có thứ tự — và cả hai đều trả lời trong một lượt lan truyền xuôi duy nhất bằng một phân phối xác suất thay vì văn bản được sinh ra; Laya, Intern-Decision-4B, Kev và phần còn lại của nhóm ngách này không thống nhất với nhau về độ dài ngữ cảnh, nên đây là cặp duy nhất mà chiều kích đó biến mất và việc so sánh buộc phải được lập luận dựa trên một thứ khác.

Thứ khác đó hóa ra lại chính là kênh đầu vào. Mô hình của Microsoft chỉ dùng văn bản, một cách rõ ràng: nó “không chấp nhận hoặc tạo ra nội dung hình ảnh, âm thanh hay video.” Mô hình của Liquid AI mang một bộ mã hóa thị giác SigLIP2 NaFlex 400 triệu tham số trên một xương sống ngôn ngữ 2,6 tỷ tham số và đạt tổng cộng 3,12 tỷ tham số, và nó được xây dựng cho đúng thứ mà Microsoft đã loại trừ — chấm điểm một ảnh chụp màn hình, một biểu mẫu quét hoặc một khung hình máy ảnh dựa trên một câu hỏi cố định. Sự chia tách đó, cộng với một khác biệt về giấy phép không liên quan gì đến năng lực, chính là toàn bộ cuộc so tài.

Khi cả hai đồng thuận, điều đó còn nhiều hơn mức bạn mong đợi.

• Cửa sổ ngữ cảnh — 32.768 token cho Microsoft-Decision-1 và 32.768 token cho Liquid AI d1-3B.

• Dạng đầu ra — xác suất đã hiệu chỉnh trên các lựa chọn được cung cấp; cả hai đều không tạo văn bản, và bộ đếm mức sử dụng của Liquid AI báo cáo thực tế đó là output_tokens: 0.

• Các loại câu hỏi — cả lựa chọn tài liệu, điểm số có thứ tự và có/không nhị phân, và cả hai đều cho phép bạn xác định tập hợp lựa chọn theo từng yêu cầu thay vì phải huấn luyện lại một đầu từ vựng.

• Không trả lời — Microsoft ghi nhận các tùy chọn không trả lời rõ ràng như “không thể cho biết”; lược đồ Decision Index của Liquid AI cũng hỗ trợ điều tương tự thông qua bộ tùy chọn của mình.

• Suy luận một lượt — một lần gọi cho mỗi quyết định ở cả hai phía, chính điều này khiến mỗi bên trở nên khả thi ở khối lượng pipeline.

Việc hai mô hình đồng ý với nhau về hai ràng buộc khó nhất trong lĩnh vực này là điều đáng để dừng lại suy nghĩ. Cửa sổ 32K là thứ giúp một bộ chấm điểm quyết định hoạt động trên toàn bộ hợp đồng, một chính sách nhiều trang hoặc một luồng hỗ trợ dài; còn checkpoint Laya tiếng Anh 512 token và giới hạn số câu hỏi mỗi lần gọi trên Intern-Decision-4B thì không. Nếu đầu vào của bạn ngắn, phần lớn lĩnh vực này có thể hoán đổi cho nhau và quyết định nằm ở khâu lưu trữ. Nếu đầu vào của bạn dài, lĩnh vực thu hẹp lại chỉ còn hai mô hình này.

Cảm giác rằng chỉ một trong số họ có

Liquid AI d1-3B là đa phương thức, và cây mô hình cho thấy rõ dòng dõi: LFM5-2.6B-Base, rồi LFM5-VL-3, d1-3B được huấn luyện hậu kỳ cho các quyết định hiệu chuẩn trong một lượt. Hình ảnh đi vào qua bộ mã hóa SigLIP2 NaFlex, và thẻ mô hình báo cáo điểm trung bình 74.1 trên mười một benchmark hình ảnh công khai, so với 73.9 của mô hình thị giác cơ sở — vậy nên việc tinh chỉnh cho quyết định không làm mất đi chất lượng thị giác của nó. Thẻ cũng báo cáo thí nghiệm ngược lại: loại bỏ hình ảnh ra thì cùng những câu hỏi đó giảm xuống 45.1, đây là bằng chứng rõ ràng nhất mà bạn có thể có rằng kênh tri giác là thành phần chịu lực chứ không phải chỉ để trang trí.

Microsoft-Decision-1 không có bản tương đương, và việc thiếu sót này là cố ý chứ không phải chưa hoàn thiện. Thẻ của Microsoft liệt kê các mục đích sử dụng ngoài phạm vi là tạo văn bản, trả lời câu hỏi mở, hội thoại, dịch và tóm tắt, đồng thời nêu riêng rằng mô hình chỉ xử lý văn bản. Đối với một pipeline cần chấm điểm ảnh chụp màn hình của một biểu mẫu theo rubric, hoặc quyết định liệu một khung hình camera có chứa sự kiện an toàn hay không, đó là một điểm dừng cứng — không có kỹ thuật gợi ý nào khôi phục được một phương thức mà mô hình chưa từng được cung cấp.

Số lượng ngôn ngữ lại đi theo hướng ngược lại, và đây là sự phân chia thực sự thứ hai. Microsoft-Decision-1 liệt kê 25 ngôn ngữ được hỗ trợ, và công ty thẳng thắn rằng độ bao phủ, chất lượng và hiệu chỉnh “có thể khác nhau tùy theo ngôn ngữ”, đồng thời nêu rõ các ngôn ngữ không phải tiếng Anh và đặc biệt là các ngôn ngữ ít tài nguyên là một lĩnh vực chưa đạt yêu cầu. Liquid AI d1-3B nêu 16 ngôn ngữ. Về độ rộng, Microsoft nhỉnh hơn trên giấy tờ; về mức độ trung thực khi nói về ý nghĩa của độ rộng, cả hai nhà cung cấp nói điều tương tự, và không bên nào công bố hiệu chỉnh theo từng ngôn ngữ.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

Lại là tab benchmark

Trang Foundry của Microsoft-Decision-1 có một tab Benchmarks với phần phương pháp luận và không có số liệu nào: các benchmark ra quyết định công khai và cộng đồng cùng các tập nội bộ held-out, các chỉ số bao gồm độ chính xác và lỗi hiệu chỉnh, thứ tự tùy chọn được thay đổi, các kiểm định thống kê theo cặp, và một tuyên bố rằng mô hình "hoạt động ngang bằng với các mô hình ra quyết định hàng đầu và vượt trội so với các mô hình ra quyết định mở khác được đánh giá bằng cùng phương pháp luận." Không có gì để kiểm tra, không có gì để tái tạo.

Liquid AI d1-3B công bố 48,57 trên Decision Index 0.2.1 — và yếu tố định ngữ quan trọng hơn con số, bởi vì Decision Index là chỉ số của chính Liquid AI và d1-3B là mô hình của chính Liquid AI. Đây là kết quả được chấm điểm bởi nhà cung cấp trên một bài kiểm chuẩn do nhà cung cấp tự soạn, được công ty định vị là tốt nhất trong số các mô hình ra quyết định dưới 10B và vượt trội so với một mô hình 35B trên cùng thang đo. Hãy coi 48,57 là một tuyên bố mang tính định hướng, chứ không phải là một con số đã được kiểm toán. Bên cạnh đó, thẻ này liệt kê các đánh giá định dạng ra quyết định nội bộ với trung bình là 77,1, SQuAD 2.0 ở mức 85,3, PAWS-X ở mức 76,9 và DecisionBench ở mức 71,8 — tất cả đều tự báo cáo, và cách diễn đạt "dưới 10B" là một định ngữ chính đáng chứ không phải là một cách né tránh, vì mô hình có 3,12B.

Vậy nên, câu hỏi hiệu chuẩn được giải quyết theo cùng một cách như nó diễn ra trong toàn bộ lĩnh vực này: Liquid AI cung cấp cho bạn một con số được tạo ra trên thang đo của riêng họ, Microsoft cung cấp cho bạn một phương pháp luận và không có con số, còn cả hai đều không cung cấp cho bạn một phép đo độc lập từ bên thứ ba. Chỉ số hiệu chuẩn duy nhất sẽ quan trọng đối với việc triển khai của bạn là chỉ số mà bạn tự tính toán trên dữ liệu đã được gán nhãn của chính mình.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

Việc phục vụ, giấy phép và những gì bạn thực sự đang mua

Độ trễ của d1-3B đã được công bố và đó chính là lý do mô hình này tồn tại. 8 mili giây mỗi quyết định trên RTX 4090, 9 trên AMD MI325X, với thông lượng đóng gói 475 và 1.106 mỗi giây ở 64 trạng thái. Trên phần cứng biên: 30 ms trên Apple M5 Pro, 16 ms trên Jetson AGX Thor, 26 ms trên Jetson AGX Orin 64 GB, 50 ms trên Orin Nano. Microsoft-Decision-1 không công bố bất kỳ con số độ trễ nào, và các tùy chọn được thiết kế sẵn của nó — một API Foundry được lưu trữ theo hình thức trả theo mức dùng hoặc thông lượng cấp phát dành riêng, với suy luận theo lô bị vô hiệu hóa — nghĩa là bạn phải đo nó thông qua triển khai của riêng mình. Đó không phải là một khoảng cách nhỏ đối với một mô hình mà toàn bộ mục đích là được gọi một lần cho mỗi tài liệu được truy xuất hoặc hành động được đề xuất.

Giấy phép là điểm mà hai mô hình khác biệt theo cách khiến người ta bất ngờ. Liquid AI d1-3B được gắn thẻ lfm1.0, không phải Apache 2.0 — cùng loại giấy phép như phần còn lại của dòng LFM thuộc Liquid, vốn mang các điều kiện sử dụng mà một giấy phép permissive không có. Nếu bộ phận pháp lý của bạn đọc theo kiểu "tương thích OpenAI không ràng buộc", thì đây không phải như vậy, và nên đọc trước khi mô hình được phát hành chứ không phải sau đó. Microsoft-Decision-1 hoàn toàn không có trọng số: nó là một endpoint được lưu trữ thuộc danh mục Direct from Azure, với xác thực Azure, thanh toán hợp nhất, không tải xuống, và câu hỏi về giấy phép được thay bằng một thỏa thuận dịch vụ. Cả hai mô hình đều không thể được tinh chỉnh thông qua các đường dẫn mà nhà cung cấp tài liệu hóa, đây là hạn chế gay gắt nhất đối với một mô hình ra quyết định — một bộ chấm điểm mà bạn không thể điều chỉnh theo nhãn của riêng mình là một bộ chấm điểm mà bạn không thể sửa các kiểu lỗi của nó, chỉ có thể đi vòng quanh chúng.

Định tuyến vòng qua chúng chính là vị trí của OrcaRouter trong mô hình này, và chỉ ở một phía của nó. Chúng tôi không lưu trữ cả Microsoft-Decision-1 lẫn Liquid AI d1-3B: cả hai đều không trả về văn bản, cả hai đều không có trong danh mục của chúng tôi, và một endpoint chấm điểm xác suất không phải là mục tiêu chat-completions. Thứ chúng tôi cung cấp là nửa tạo sinh của vòng lặp — mô hình soạn thảo câu trả lời mà bộ chấm điểm của bạn sẽ đánh giá, trích xuất các trường mà bộ chấm điểm của bạn sẽ phán định, hoặc đề xuất hành động mà bộ chấm điểm của bạn sẽ phê duyệt. Đó là hơn 200 mô hình phía sau một khóa tương thích OpenAI ở mức giá niêm yết của nhà cung cấp được chuyển qua với 0% markup, nên thay đổi giá của nhà cung cấp có hiệu lực phía chúng tôi ngay trong cùng ngày, và chuyển đổi dự phòng tự động bao phủ lệnh gọi tạo sinh trong một vòng lặp không còn độ trễ dư để thử lại một lần.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Hai lựa chọn rõ ràng, và một lựa chọn không hề sát nút

Hãy chọn Liquid AI d1-3B nếu bất cứ thứ gì trong pipeline của bạn là hình ảnh. Sàng lọc ảnh chụp màn hình, trích xuất biểu mẫu, định tuyến QA trực quan, một kiểm duyệt viên chấm điểm các khung hình camera — Microsoft-Decision-1 không thể được dùng để làm việc này, và d1-3B được xây dựng cho việc đó với các benchmark thị giác được công bố để hậu thuẫn cho tuyên bố này. Cũng hãy chọn nó nếu bạn cần suy luận ở biên được đo bằng hàng chục mili giây trên Jetson hoặc laptop, nếu bạn muốn mô hình trên phần cứng của riêng bạn, hoặc nếu một giấy phép mà bạn có thể đọc là đủ đối với cố vấn pháp lý của bạn.

Chọn Microsoft-Decision-1 nếu đầu vào của bạn là văn bản, tài liệu của bạn dài, cổng quyết định của bạn là mua sắm — xác thực Azure, thanh toán hợp nhất, đánh giá AI có trách nhiệm, một nhà cung cấp để leo thang — hoặc lưu lượng truy cập của bạn bao gồm hơn 16 ngôn ngữ mà d1-3B liệt kê. Hãy chấp nhận rằng việc thiếu số liệu độ trễ và thiếu bảng điểm chuẩn của nó nghĩa là hai tuần đầu tiên của bạn với nó là đo lường, không phải tích hợp.

Trường hợp duy nhất không hề sát nút là công việc đa phương thức: ở đó, lựa chọn đã được định đoạt ngay khi Microsoft ghi "chỉ văn bản" vào thẻ mô hình.