一張為 Microsoft-Decision-1 對上 Liquid AI d1-omni-600M 生成的標題卡,副標題為「此類別中最寬的感測器表面,對上最窄的輸入清單」,標籤寫著:具備視覺與音訊的 587M 參數、僅支援文字的 Foundry API、30 秒語音對上 32,768 個文字 token、雙向編碼器對上後訓練解碼器,以及雙方皆無公開校準。
Engineering & Research

Microsoft-Decision-1 vs Liquid AI d1-omni-600M:一個會聆聽的評分器,對上一個只會閱讀的評分器

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

你在保險理賠櫃檯負責分流理賠案件,而送來的檔案包含三樣東西:一份 PDF、一張凹陷車門的照片,以及一通九十秒的電話錄音。Liquid AI d1-omni-600M能讀取文件、查看照片並聆聽通話,接著在一次處理中回答你事先寫好的一組問題——這是否在承保範圍內、屬於哪個類別、嚴重程度如何,以二到十分為尺度——過程中不生成任何文字,也沒有任何東西需要解析。Microsoft-Decision-1能讀取文件。它於2026年10月8日在 Microsoft Foundry 正式推出,是以 Qwen3.5-9B 進行後訓練的託管純文字評分器,具有 32,768 個詞元的上下文視窗,而其輸入範圍就僅止於此:沒有影像、沒有音訊、沒有視訊。兩者都會針對你提供的選項回傳經校準的機率,兩者都不輸出任何詞元,且兩者都尚未公布校準數據。

最後那句共同說法,是這項比較中令人不安的部分。這兩者是本月出貨的決策模型中,搭載最寬感測器與最窄感測器的模型;而儘管兩者之間的架構差距如此之大,它們卻正好落在完全相同的證據立場上:真實權重或真實端點、有文件記載的合約,以及當有人問起這些機率是否值得信賴時,沒有任何廠商外部人士能指出的數字。

兩種血統,而非兩種體型

587M 這個數字會引人把 Liquid AI d1-omni-600M 解讀成本部落格先前介紹過的模型之縮小版親戚。但事實並非如此。這個模型的訓練基礎是 LFM2.5-Encoder-350M,一個雙向編碼器,加上 381M 的共享主幹與決策頭、取自 LFM2.5-VL-450M 系列的 94M 視覺編碼器,以及17 層 FastConformer用於音訊。Microsoft-Decision-1 則完全屬於另一條血統:一個由 Microsoft 後訓練的 Qwen3.5-9B 解碼器,託管於 Foundry,權重未對外散布,也未提供微調途徑。

雙向模型與解碼器之間的差異,是決定各自行為表現的架構事實,也是參數量之所以令人分心的原因。雙向編碼器一次讀取整個狀態,這正是對固定輸入做出判斷時應有的形態;經過後訓練的解碼器則放棄了生成路徑,但保留了分詞器、視窗,以及伴隨 foundry 部署而來的企業級封裝。兩者都不是對方的放大版,而且無論怎麼解讀基準測試表格,都不能將兩者互換。

輸入清單實際上能帶給你什麼

這正是 d1-omni-600M 與該類別中其他一切差異最為劇烈的地方,也是某項宣稱必須仔細解讀的地方。

• 語音 — Liquid AI d1-omni-600M 可接受文字,外加最多 30 秒的語音,並據此回報一項決策,這是任何純文字評分器無論準確度多高都做不到的。Microsoft-Decision-1 的非文字模態並不存在。

• 互斥 — 若圖像與音訊出現在同一個請求中,d1-omni-600M 會引發 ValueError。同類產品中最廣泛的感測器表面,仍然一次僅限一種非文字模態,這對該理賠櫃檯而言是一項實際限制。

• 截斷 — 其卡片指出文字、圖像與音訊的合計位置為 16,384,並補充說在有圖像的情況下,狀態與問題文字會被截斷至 896 個符元 以符合訓練。無論你把照片附加到哪份文件,該文件都得和這項截斷競爭。Microsoft-Decision-1 的 32,768 個符元全是文字,且不會被截斷。

• 格式 — d1-omni-600M 有三種題型:noul用於二元決策,回傳介於 0 與 1 之間的 P(yes),choice用於從你命名的一組標籤中選出一個標籤,並附上信心值與每個選項的機率,以及score用於在二到十個層級的有序量表上指出位置及其分布。多個問題依附在同一個狀態上,並在一次傳遞中讀取,而用量計數器會回報output_tokens: 0。Microsoft 記載了是/否、多選、評分、分類與評分規準等形態,另外還有一個明確支援的棄權選項,例如在證據不足時使用「無法判斷」——這是 Microsoft 頁面上唯一沒有直接對應項的設計細節。

• 執行階段 —— d1-omni-600M 隨附自訂程式碼,需要 trust_remote_code=True,而且其模型卡建議在 GPU 上使用 float16,同時警告 bfloat16 會改變某些資料列的首要答案。這是供應商記錄在案的推論服務期敏感度,並非瑕疵。Microsoft-Decision-1 是託管端點,部署形態是你唯一的執行階段變數,而值得注意的是批次推論已遭停用:沒有離線通道可用來攤銷大規模評分作業。

A two-column generated scoreboard titled Microsoft-Decision-1 vs Liquid AI d1-omni-600M. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; base post-trained Qwen3.5-9B decoder; inputs text only; context 32,768 tokens of text, untrimmed; weights not distributed; calibration not published. Right column Liquid AI d1-omni-600M rows read: availability uploaded October 7, 2026; base LFM2.5-Encoder-350M bidirectional encoder with 587M total; inputs text, images, or 30 seconds of speech, one non-text modality at a time; context 16,384 positions with text trimmed to 896 tokens when images are present; weights open under lfm1.0; calibration not published. A footer line reads that neither vendor has published an accuracy or calibration benchmark for these models.

證據缺口,雙向皆然

Liquid AI 於 2026 年 10 月 7 日發布了開源的 d1 系列,其中包括 d1-omni-600M,並隨附一篇發布文章與一套文件。沒有發布的,是那個能讓多模態主張變得具體的數字。針對它自家招牌能力——也就是足以證明 94M 與 112M 編碼器有其價值的視覺與音訊決策品質——並沒有專屬的準確度基準,而視覺部分也從已發布的評估資料中隱去。延遲數字同樣付之闕如,因此模型的輸送量得靠你自己在自家硬體上摸索。

Microsoft 的定位在結構上如出一轍,而且又往前推進了一步。其 Benchmarks 分頁列出了各項指標——準確度、校準誤差、安全召回率、偽陽性率、公平性一致性——並表示評估是在公開與社群決策基準,加上未用於訓練的保留內部測試集上進行,選項順序有加以變化,且套用了配對統計檢定,並宣稱該模型「表現與領先的決策模型相當,且優於以相同方法評估的其他開放決策模型」。它未列出任何結果。頁面列出支援二十五種語言,包括日語、韓語、阿拉伯語、越南語、泰語、土耳其語、印地語、孟加拉語、斯瓦希里語、希伯來語、波斯語和烏克蘭語,並坦率警告:涵蓋範圍、品質與校準「可能因語言而異」,而非英語、尤其是低資源語言,則是一大弱點。定價同樣不在模型頁面上;而是外連到 Microsoft 的定價頁面。

所以,這兩者之間的比較並不是證據對證據的較量。而是在兩種缺失的數字之間做選擇。Liquid AI 已推出感測器表面,卻未公開量測該表面的準確性。Microsoft 已交付採購路徑——Azure 驗證、治理、負責任 AI 評估、有文件記載的方法論——卻未量化機率產品的校準。

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

他們兩人都沒有回答的那個校準問題

對決策模型而言,機率就是最終產物。下游的一切都是閾值:0.7 會升級處理,0.95 會自動接受,而這條線劃錯的代價,是以糟糕的自動化決策來償付,而不是以 token 來支付。在這個類別中,至少有一個系列會公布這些數字——InternLM 的 Intern-Decision 檢查點會在其模型卡上印出 Brier 與期望校準誤差(expected-calibration-error)數值——而本文中的兩個模型都沒有這樣做。這種不對稱正是實務上應該保持候選範圍寬廣、而非僅憑架構就定案的理由。

好消息是,這個測試很便宜,而且不需要供應商的配合。組裝兩百個左右、看起來像你真實流量的已標註案例,寫出你的應用程式實際會送出的問題結構描述,讓兩個模型分別跑過這些案例,並計算輸出上的期望校準誤差。屆時你將會知道兩件目前這兩家供應商之外沒有人知道的事:Microsoft-Decision-1 的機率值在你資料分布上與其準確度的吻合程度有多高,以及 d1-omni-600M 的音訊與影像路徑是否值得它們所搭載的編碼器。Microsoft 自家有文件記載的指引也指向同一方向——在具代表性的資料上驗證、根據你犯錯的成本設定閾值、永遠納入棄權選項、隨機化選項順序,並在後果重大的決策中保持人在迴路中。

各自屬於哪裡,以及 OrcaRouter 屬於哪裡

Microsoft-Decision-1 適用於任何決策素材是文字、而阻礙在於採購的情況:一份長篇文件、一段檢索到的段落、一個提議的工具呼叫、一個依評分規準評分的生成答案,並且在任何內容進入正式環境之前,需要 Azure 驗證、統一帳單與供應商評估。它是較狹義的工具,也是較容易獲得核准的一種。

Liquid AI d1-omni-600M 適用於任何關鍵判斷材料不是文字的地方——表單附上的照片、簡短的通話錄音、螢幕截圖——也適用於任何你想在可控制的界線內執行與微調 lfm1.0 權重的地方。它是涵蓋面更廣的工具,也是更難驗證的一種,因為多模態這項主張,正是背後沒有已發表基準測試支撐的部分。

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

兩者都不在我們的目錄中,本文也沒有對其中任何一方作出可用性聲明。一個回傳機率而非文字的模型,並不是你會把對話補全導向的對象,而遠離評分席位正是這套工具的整體設計。OrcaRouter 所承載的,是同一個迴路的生成端:一把與 OpenAI 相容的金鑰背後的 200 多個模型,它們撰寫你的評分器據以評分的評分標準、在素材成為狀態之前加以轉錄或摘要,並發出你的評分器在執行前核准的工具呼叫。供應商的定價清單以 0% 加成原樣轉嫁,因此生成端的廠商降價,當天就在我們這邊生效。當單一供應商效能下降時,自動容錯移轉讓那一端保持運作——而一套為每份檢索到的文件評分的流程會立刻察覺此事——如果你想評判的是多位撰寫者而非一位,路由 DSL 會將它們組成單一呼叫,而模型融合會回報它們的一致程度,成為一個你的評分器可以像讀取任何其他欄位一樣讀取的欄位。

底線

Microsoft-Decision-1 於 2026 年 10 月 8 日在 Microsoft Foundry 正式推出:僅支援文字、32,768 個 token,建構於經過後訓練的 Qwen3.5-9B 之上,以託管方式提供但不公開權重,模型頁面上沒有價格、沒有延遲數據,其基準測試區段只描述方法論而未印出任何結果。Liquid AI d1-omni-600M 於 2026 年 10 月 7 日上傳,是一個 587M 的雙向編碼器決策模型,可讀取文字、圖像或 30 秒的語音——一次僅限一種非文字模態,且當圖像存在時文字會裁剪至 896 個 token——採用 lfm1.0 授權,其主打能力沒有準確度基準測試,沒有視覺拆分,也沒有公布延遲數據。請依模態與控制性來選擇,而不是依分數,因為那些分數根本不存在:如果你的素材是一張照片或一通電話,這兩者中只有一個能回答;而如果是一份附有採購審查的四十頁文件,則只有另一個能部署。

OrcaRouter 所承載的,是同一個迴圈的生成端:超過 200 個模型位於一把與 OpenAI 相容的金鑰之後,負責撰寫你的評分器據以評分的評分標準、在素材成為狀態之前加以轉錄或摘要,並發出你的評分器在執行前所核准的工具呼叫。