Một thẻ tiêu đề được tạo cho Microsoft-Decision-1 vs Liquid AI d1-omni-600M với phụ đề 'bề mặt cảm biến rộng nhất trong phân khúc so với danh sách đầu vào hẹp nhất', cùng các chip ghi 587M tham số với thị giác và âm thanh, một Foundry API chỉ văn bản, 30 giây giọng nói so với 32,768 token văn bản, một bộ mã hóa hai chiều so với một bộ giải mã được hậu huấn luyện, và không có hiệu chuẩn nào được công bố ở cả hai bên.
Engineering & Research

Microsoft-Decision-1 vs Liquid AI d1-omni-600M: Một bộ chấm điểm biết lắng nghe đối đầu với một bộ chấm điểm chỉ biết đọc

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Bạn đang phân luồng các yêu cầu bồi thường tại quầy bảo hiểm, và hồ sơ đến dưới dạng ba thứ: một PDF, một bức ảnh chụp cánh cửa bị móp, và một cuộc gọi điện thoại dài chín mươi giây. Liquid AI d1-omni-600Mcó thể đọc tài liệu, xem ảnh và nghe cuộc gọi, rồi trả lời một loạt câu hỏi bạn đã viết trước — điều này có được bảo hiểm không, thuộc danh mục nào, mức độ nghiêm trọng ra sao, trên thang điểm từ hai đến mười — trong một lượt, không sinh ra văn bản và không có gì phải phân tích cú pháp. Microsoft-Decision-1có thể đọc tài liệu. Nó đã được phát hành rộng rãi trên Microsoft Foundry vào ngày 8 tháng 10, 2026 dưới dạng một bộ chấm điểm chỉ dùng văn bản, được lưu trữ trực tuyến, được hậu huấn luyện trên Qwen3.5-9B với cửa sổ 32.768 token, và bề mặt đầu vào của nó kết thúc ở đó: không hình ảnh, không âm thanh, không video. Cả hai đều trả về xác suất đã hiệu chỉnh trên các tùy chọn bạn cung cấp, cả hai đều không phát ra token đầu ra nào, và chưa bên nào công bố số liệu hiệu chỉnh.

Câu cuối cùng được chia sẻ đó là phần khó chịu của so sánh này. Hai mô hình này là những mô hình ra quyết định có cảm biến rộng nhất và cảm biến hẹp nhất ra mắt trong tháng này, và bất chấp mọi khoảng cách về kiến trúc giữa chúng, chúng lại rơi vào đúng cùng một vị thế bằng chứng: trọng số thực hoặc một điểm cuối thực, các hợp đồng được ghi lại, và không có con số nào mà bất kỳ ai bên ngoài nhà cung cấp có thể chỉ ra khi ai đó hỏi liệu các xác suất có đáng tin cậy hay không.

Hai nguồn gốc tổ tiên, không phải hai kích cỡ.

Con số 587M dễ khiến bạn đọc Liquid AI d1-omni-600M như một họ hàng thu nhỏ của những mô hình mà blog này từng đề cập trước đây. Không phải vậy. Mô hình này được huấn luyện từ LFM2.5-Encoder-350M, một encoder hai chiều, với phần thân chia sẻ 381M và đầu quyết định, một vision encoder 94M lấy từ dòng LFM2.5-VL-450M và một FastConformer 17 lớp dành cho âm thanh. Microsoft-Decision-1 lại thuộc một dòng hoàn toàn khác: một decoder Qwen3.5-9B, được Microsoft hậu huấn luyện, lưu trữ trên Foundry, không phân phối trọng số và không cung cấp lộ trình tinh chỉnh nào.

Mô hình hai chiều so với bộ giải mã là sự thật kiến trúc quyết định cách mỗi bên hành xử, và đó cũng là lý do số lượng tham số chỉ là một thứ gây xao nhãng. Một bộ mã hóa hai chiều đọc toàn bộ trạng thái cùng một lúc, tức khuôn dạng phù hợp cho một phán đoán trên đầu vào cố định; một bộ giải mã đã qua hậu huấn luyện từ bỏ con đường sinh nhưng vẫn giữ tokenizer, cửa sổ và gói đóng gói doanh nghiệp đi kèm với một triển khai foundry. Không bên nào là phiên bản mở rộng quy mô của bên kia, và chúng không thể được hoán đổi cho nhau bất kể bảng benchmark được đọc thế nào.

Danh sách đầu vào thực sự mang lại cho bạn điều gì

Đây là nơi d1-omni-600M khác biệt mạnh mẽ nhất so với mọi thứ khác trong danh mục, và cũng là nơi một tuyên bố cần được đọc một cách cẩn thận.

• Giọng nói Liquid AI d1-omni-600M chấp nhận văn bản cùng với 30 giây giọng nói và đưa ra quyết định dựa trên đó, điều mà không mô hình chỉ văn bản nào có thể làm được ở bất kỳ mức độ chính xác nào. Các phương thức của Microsoft-Decision-1 không tồn tại.

• Loại trừ lẫn nhau — d1-omni-600M sẽ ném ra ValueError nếu hình ảnh và âm thanh đến trong cùng một yêu cầu. Bề mặt cảm biến rộng nhất trong phân khúc này vẫn chỉ xử lý một phương thức phi văn bản tại một thời điểm, và đó là một hạn chế thực sự đối với bàn xử lý khiếu nại đó.

• Cắt bớt — thẻ của nó ghi 16.384 vị trí kết hợp cho văn bản, hình ảnh và âm thanh, đồng thời nói thêm rằng khi có hình ảnh, văn bản trạng thái và câu hỏi bị cắt còn 896 token để khớp với huấn luyện. Bất kỳ tài liệu nào bạn đính kèm ảnh vào đều đang cạnh tranh với phần cắt đó. 32.768 token của Microsoft-Decision-1 đều là văn bản và không bị cắt.

• Định dạng — d1-omni-600M có ba loại câu hỏi: noul cho quyết định nhị phân trả về P(yes) trong khoảng 0 đến 1, choice để chọn một nhãn từ một tập hợp bạn chỉ định kèm độ tin cậy và xác suất cho mỗi tùy chọn, và score cho một vị trí trên thang điểm từ hai đến mười mức với các mức của nó. Một số câu hỏi gắn với một trạng thái và được đọc trong một lượt, và bộ đếm sử dụng báo cáo output_tokens: 0. Tài liệu mô tả các dạng có/không, trắc nghiệm, đánh giá, phân loại và rubric, cùng một tùy chọn từ chối trả lời được hỗ trợ rõ ràng như "cannot tell" khi bằng chứng không đủ — chi tiết thiết kế duy nhất trên trang Microsoft không có bản tương ứng trực tiếp ở đây.

• Runtime — d1-omni-600M đi kèm mã tùy chỉnh, cần trust_remote_code=True, và thẻ mô hình của nó khuyến nghị float16 trên GPU trong khi cảnh báo rằng bfloat16 đã thay đổi câu trả lời hàng đầu ở một số dòng. Đó là độ nhạy ở thời điểm phục vụ đã được nhà cung cấp ghi nhận, không phải khiếm khuyết. Microsoft-Decision-1 là một endpoint được quản lý, nơi hình thái triển khai là biến runtime duy nhất của bạn, và đáng lưu ý rằng suy luận theo lô bị vô hiệu hóa: không có kênh ngoại tuyến nào để phân bổ chi phí cho một lượt chấm điểm hàng loạt.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Liquid AI d1-omni-600M. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; base post-trained Qwen3.5-9B decoder; inputs text only; context 32,768 tokens of text, untrimmed; weights not distributed; calibration not published. Right column Liquid AI d1-omni-600M rows read: availability uploaded October 7, 2026; base LFM2.5-Encoder-350M bidirectional encoder with 587M total; inputs text, images, or 30 seconds of speech, one non-text modality at a time; context 16,384 positions with text trimmed to 896 tokens when images are present; weights open under lfm1.0; calibration not published. A footer line reads that neither vendor has published an accuracy or calibration benchmark for these models.

Khoảng trống bằng chứng, ở cả hai hướng.

Liquid AI đã công bố dòng d1 mở, bao gồm d1-omni-600M, vào ngày 7 tháng 10 năm 2026 cùng một bài đăng phát hành và một bộ tài liệu. Điều không được công bố là con số sẽ khiến tuyên bố đa phương thức trở nên cụ thể. Không có chuẩn đánh giá độ chính xác nào dành riêng cho năng lực chủ đạo của chính nó — chất lượng ra quyết định từ thị giác và âm thanh, thứ biện minh cho các bộ mã hóa 94M và 112M — và phần thị giác bị giữ lại khỏi tài liệu đánh giá đã phát hành. Cũng không có số liệu độ trễ nào được công bố, nên thông lượng của mô hình là điều bạn tự khám phá trên phần cứng của riêng mình.

Vị thế của Microsoft có cấu trúc giống hệt và tiến xa hơn một bước. Tab Benchmarks của hãng nêu tên các chỉ số — độ chính xác, lỗi hiệu chuẩn, độ thu hồi an toàn, tỷ lệ dương tính giả, tính nhất quán về công bằng — nêu rằng đánh giá được chạy trên các benchmark quyết định công khai và cộng đồng cùng các bộ kiểm thử nội bộ giữ lại không dùng trong huấn luyện, rằng thứ tự lựa chọn đã được thay đổi, rằng các kiểm định thống kê theo cặp đã được áp dụng, và khẳng định mô hình "hoạt động ngang tầm với các mô hình quyết định hàng đầu và vượt trước các mô hình quyết định mở khác được đánh giá bằng cùng phương pháp luận." Nó không in ra bất kỳ kết quả nào. Hai mươi lăm ngôn ngữ được liệt kê là được hỗ trợ, bao gồm tiếng Nhật, tiếng Hàn, tiếng Ả Rập, tiếng Việt, tiếng Thái, tiếng Thổ Nhĩ Kỳ, tiếng Hindi, tiếng Bengal, tiếng Swahili, tiếng Hebrew, tiếng Ba Tư và tiếng Ukraina, cùng cảnh báo thẳng thắn rằng độ bao phủ, chất lượng và hiệu chuẩn "có thể thay đổi tùy theo ngôn ngữ" và rằng tiếng không phải tiếng Anh, đặc biệt là các ngôn ngữ ít tài nguyên, là một điểm yếu. Giá cũng không có trên trang mô hình; nó liên kết ra ngoài tới bề mặt định giá của Microsoft.

Vậy nên, việc so sánh giữa hai bên này không phải là bằng chứng đối đầu với bằng chứng. Đó là sự lựa chọn giữa hai kiểu con số còn thiếu. Liquid AI đã tung ra bề mặt cảm biến và để độ chính xác của bề mặt đó không được đo lường công khai. Microsoft đã tung ra lộ trình mua sắm — xác thực Azure, quản trị, đánh giá AI có trách nhiệm, một phương pháp luận được ghi chép — và để việc hiệu chỉnh một sản phẩm xác suất không được định lượng.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

Câu hỏi hiệu chuẩn mà cả hai người đều không trả lời

Với một mô hình ra quyết định, xác suất chính là sản phẩm. Mọi thứ phía sau đều là một ngưỡng: 0,7 thì chuyển cấp, 0,95 thì tự động chấp nhận, và cái giá của việc vạch sai đường ranh giới đó được trả bằng những quyết định tồi chứ không phải bằng token. Trong hạng mục này, có ít nhất một dòng mô hình công bố các con số — những checkpoint Intern-Decision của InternLM in chỉ số Brier và sai số hiệu chuẩn kỳ vọng trên thẻ mô hình của chúng — còn cả hai mô hình trong bài viết này thì không. Sự bất đối xứng đó chính là lý do thực tiễn để giữ phạm vi lựa chọn rộng thay vì chỉ cam kết dựa trên kiến trúc mà thôi.

Tin tốt là bài kiểm tra này rẻ và không đòi hỏi sự hợp tác của nhà cung cấp. Hãy tập hợp vài trăm trường hợp đã gán nhãn trông giống lưu lượng thực tế của bạn, viết lược đồ câu hỏi mà ứng dụng của bạn thực sự sẽ gửi, chạy cả hai mô hình trên chúng, rồi tính lỗi hiệu chuẩn kỳ vọng trên đầu ra. Sau đó bạn sẽ biết hai điều mà hiện không ai ngoài hai nhà cung cấp biết: xác suất của Microsoft-Decision-1 phản ánh độ chính xác của nó trên phân phối dữ liệu của bạn tốt đến đâu, và liệu các nhánh âm thanh và hình ảnh của d1-omni-600M có xứng đáng với các bộ mã hóa mà chúng mang theo hay không. Hướng dẫn được chính Microsoft ghi lại cũng chỉ về cùng hướng đó — xác thực trên dữ liệu đại diện, đặt ngưỡng dựa trên chi phí sai sót của bạn, luôn bao gồm một tùy chọn không trả lời, ngẫu nhiên hóa thứ tự các tùy chọn, giữ con người trong vòng lặp đối với các quyết định quan trọng.

Nơi mỗi thứ thuộc về, và nơi OrcaRouter làm điều đó

Microsoft-Decision-1 phù hợp ở bất cứ đâu mà dữ liệu để ra quyết định là văn bản và rào cản là mua sắm: một tài liệu dài, một đoạn trích được truy xuất, một lệnh gọi công cụ được đề xuất, một câu trả lời được tạo ra đang được chấm theo rubric, cùng với xác thực Azure, thanh toán hợp nhất và đánh giá nhà cung cấp được yêu cầu trước khi bất cứ thứ gì đi vào môi trường sản xuất. Đây là công cụ có phạm vi hẹp hơn và là công cụ dễ được phê duyệt hơn.

Liquid AI d1-omni-600M phù hợp ở bất cứ đâu mà thông tin mang tính quyết định không phải là văn bản — một bức ảnh đính kèm vào biểu mẫu, một bản ghi âm cuộc gọi ngắn, một ảnh chụp màn hình — và ở bất cứ đâu bạn muốn trọng số lfm1.0 mà bạn có thể chạy và tinh chỉnh trong một ranh giới do bạn kiểm soát. Nó là công cụ bao quát hơn và cũng là công cụ khó xác thực hơn, bởi vì tuyên bố đa phương thức chính là phần không có benchmark nào được công bố đằng sau nó.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

Cả hai đều không nằm trong danh mục của chúng tôi, và không có gì ở đây là tuyên bố về tính sẵn có cho cả hai. Một mô hình trả về xác suất thay vì văn bản không phải là thứ bạn định tuyến các chat completion tới, và việc đứng ngoài ghế chấm điểm chính là toàn bộ thiết kế của công cụ này. Điều OrcaRouter cung cấp là phía tạo sinh của cùng vòng lặp đó: hơn 200 mô hình đứng sau một khóa tương thích OpenAI mà tạo ra rubric để bộ chấm điểm của bạn chấm dựa trên đó, chép lại hoặc tóm tắt tài liệu trước khi nó trở thành một state, và phát ra tool call mà bộ chấm điểm của bạn phê duyệt trước khi nó chạy. Giá niêm yết của nhà cung cấp được chuyển tiếp nguyên vẹn với mức markup 0%, nên khi nhà cung cấp giảm giá ở phía tạo sinh thì bên chúng tôi cũng có hiệu lực ngay trong cùng ngày. Cơ chế chuyển đổi dự phòng tự động giữ cho phía đó luôn hoạt động khi một nhà cung cấp đơn lẻ suy giảm — điều mà một pipeline chấm điểm mọi tài liệu được truy xuất sẽ nhận ra ngay lập tức — và nếu bạn muốn nhiều người viết cùng được đánh giá thay vì chỉ một, DSL định tuyến sẽ kết hợp chúng thành một lời gọi duy nhất và model fusion báo cáo mức đồng thuận của chúng như một trường mà bộ chấm điểm của bạn có thể đọc như bất kỳ trường nào khác.

Điểm mấu chốt

Microsoft-Decision-1 đạt trạng thái khả dụng chung trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026: chỉ văn bản, 32,768 token, được xây dựng trên Qwen3.5-9B đã qua hậu huấn luyện, được host mà không có trọng số, không có giá trên trang mô hình, không có số liệu độ trễ và một phần benchmark mô tả phương pháp luận mà không in ra kết quả. Liquid AI d1-omni-600M được tải lên vào ngày 7 tháng 10 năm 2026 dưới dạng mô hình ra quyết định dùng bộ mã hóa hai chiều 587M, đọc văn bản, hình ảnh hoặc 30 giây giọng nói — mỗi lần một phương thức phi văn bản, với văn bản được cắt bớt còn 896 token khi có hình ảnh — theo giấy phép lfm1.0, không có benchmark độ chính xác cho năng lực nổi bật của nó, không có phân tách thị giác và không có độ trễ được công bố. Hãy chọn theo phương thức và khả năng kiểm soát thay vì theo điểm số, vì các điểm số không tồn tại: nếu dữ liệu của bạn là một bức ảnh hoặc một cuộc gọi điện thoại, chỉ một trong hai mô hình này có thể trả lời, và nếu đó là một tài liệu bốn mươi trang kèm theo bản rà soát mua sắm, chỉ mô hình còn lại mới có thể được triển khai.

Thứ mà OrcaRouter mang lại là phía tạo sinh của cùng vòng lặp đó: hơn 200 mô hình đằng sau một khóa tương thích OpenAI, chúng viết nên bảng tiêu chí mà bộ chấm điểm của bạn đánh giá dựa theo, phiên âm hoặc tóm tắt tài liệu trước khi tài liệu trở thành một trạng thái, và phát ra lệnh gọi công cụ mà bộ chấm điểm của bạn phê duyệt trước khi lệnh đó chạy.