Liquid AI 開放權重決策模型的主視覺標題卡,標題為「兩個從不寫下任何字的模型」,副標題為「Liquid AI d1-3B 與 d1-omni-600M,開放權重,2026 年 10 月 7 日」,三個標示為「是/否」的標籤晶片,選擇一個標籤並在量表上評分,以及一張圖表,描繪一個狀態進入單次前向傳遞,回傳一個機率、一個標籤和一個分數。
Guides & Insights

Liquid AI d1-3B 與 d1-omni-600M:為從不寫下任何一個字的模型開放權重

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Liquid AI d1-3B 與 Liquid AI d1-omni-600M 於 2026 年 10 月 7 日上架 Hugging Face,而這兩個檢查點具備一項特性,讓你在今年讀過的每一份比較表全都成了錯誤的形狀。兩者都不生成文字。你把一個狀態——一張客服工單、一份 JSON 酬載、一張照片,或三者同時——以及一組具名問題交給 Liquid AI d1-3B,它就會回傳直接從模型對你各選項的分布中摘取的答案。是/否,以機率表示。在標籤之間做出選擇,附上信心值與完整的機率向量。在有序列尺上的一個位置。沒有取樣步驟、沒有 JSON 要解析、沒有失控的生成,而廠商自家的用量計數器更是直白地報告了這件事:output_tokens: 0。3B 模型是頭條焦點——它在廠商評分的 Decision Index 0.2.1 上拿下 48.57,領先所有 10B 以下的模型,也領先一個體積是它十二倍的決策模型。600M 的同門兄弟才是值得關注的那個:它透過同一組主幹權重讀取影像與最多三十秒的語音,並被標記為早期研究版本。

用一段話說明什麼是決策模型。

這個類別已經發展了一年,名稱包括系統一模型和「不是分類器的分類器」之類,而 d1 pair 是目前為止對它最清楚的表述。生成式模型被問一個問題並寫出答案;答案必須被解析,解析可能失敗,而且它寫出的每個 token 都會花費你的金錢和時間。決策模型被問一個問題,並報告它已經相信的內容。Liquid 的問題有三種類型。 noul 是是非題,以 0 到 1 之間的 P(yes) 來回答。 選擇 會從具名集合中挑選一個標籤,並回傳該標籤、一個信心值,以及每個選項的機率。 評分 會將狀態放在一個二到十個層級的有序尺度上,並回傳期望層級及其分佈和圖例。一個狀態可以同時承載數個問題,而該狀態及其影像只需讀取一次,即可供所有問題使用。

最後那項特性就是整個商業論證的核心。針對同一張工單問三個問題,所花時間只是一次提問的 1.3 倍,而不是 3 倍,因為模型只對輸入做一次前向傳遞,就能從中讀出好幾個答案。沒東西要寫,自然也就沒有寫得糟這回事。

3B 與 600M 是從相反方向建構而成的

這正是這次發布在技術上開始變得有趣的地方,而這也是發表報導大多略過的部分。這兩個模型並非同源。

Liquid AI d1-3B源自 LFM2.5-VL-3B,這是該廠商旗下僅具解碼器的視覺語言模型。它擁有 3.12B 參數、一個 SigLIP2 NaFlex 形狀最佳化的 400M 視覺編碼器、32,768 個符元的上下文視窗、128,000 個符元的詞彙表,以及十六種已記載的語言。為了打造它,Liquid 將 LFM2.5-2.6B 與 LFM2.5-VL-3B 文字主幹的權重取平均,對來自數個隨機種子與資料混合的檢查點進行微調,然後再次合併結果。廠商自己對什麼才是關鍵的總結,令人耳目一新地毫不浮誇:在長輸入上訓練、打亂答案選項的順序,以及在訓練資料中揪出捷徑,對最終數字的貢獻都比任何先進技巧更大。

Liquid AI d1-omni-600M衍生自 LFM2.5-Encoder-350M,那是一個雙向編碼器——完全是另一種類型的網路。它的參數總計 5.87 億,拆分為 3.81 億的共享主幹與決策頭、從 LFM2.5-VL-450M 借用的 9,400 萬參數視覺編碼器,以及由 17 層 FastConformer 構成的 1.12 億參數音訊編碼器。每一種模態都經由同一組主幹權重運行。其上下文為 16,384 個詞元,同時涵蓋文字、圖像與音訊位置;而在附帶圖像時,狀態與問題文字會被縮減至 896 個詞元,因為那正是它受訓時的情況。音訊方面有一項警告,模型卡毫不含糊地指出:該能力是以英語使用者與助理之間的請求訓練而成,且音訊片段會裁剪至三十秒。

所以這個家族並不是同一個模型的兩種大小。它是一個解碼器和一個編碼器,經過後訓練,以兩種完全不同的機制執行相同的工作,其中一個能看,另一個能聽。

A two-column scoreboard for Liquid AI d1-3B and d1-omni-600M showing d1-3B at Decision Index 48.57 with 3.12B parameters, text and image input and 8 ms per question on an RTX 4090, against d1-omni-600M at 15.95 with 587M parameters, text, image and audio input and no reported latency, footed 'All figures vendor-reported by Liquid AI, Oct 7 2026; no independent reproduction.'

這些數字,以及它們屬於誰

本節中的每一項數字都是 Liquid 自己的。d1 模型的 Decision Index 資料列是由供應商使用官方評分器評分——並未提交至排行榜——而每一個競爭對手的資料列都來自 v0.2.1 的公開排行榜。目前尚無獨立實驗室重現其中任何內容,而且撰寫本文時,這些模型才問世兩天。

• 決策指數 0.2.1 — Liquid AI d1-3B 得分 48.57,子分數為知識 23.8、語言 56.4、檢索 52.8、工具 74.5 與藝術 36.3。Liquid AI d1-omni-600M 得分 15.95,其中工具為 15.1。

• 48.57 位居何處——在廠商公布的表格中,於所有低於 10B 的項目裡排名第一,並領先得分 47.11 的 Decider 35B-A3B。整體排名第二,落後於 50.02 的 Winnow-12B,而後者的規模是它的四倍。

• 文字基準測試,廠商回報——d1-3B 在七項公開基準測試中平均為 82.9,領先 Decider 4B 的 81.1;d1-omni-600M 平均為 78.4,在參數量約僅四分之一的情況下勝過 Decider 2B 的 77.1。600M 在該表中拿下最佳毒性分數(Civil Comments 95.8),以及最佳改寫分數(PAWS-X 79.5)。

• 視覺,廠商報告 — d1-3B 在十一項公開圖像基準測試中平均達 74.1,這些測試是依據對各基準選項所做的決策來判讀,而其 LFM2.5-VL-3B 骨幹則為 73.9。移除圖像後,同樣的問題分數會降至 45.1,廠商藉此顯示答案確實來自像素。

• 延遲(由廠商實測)——一個問題在 RTX 4090 上需時 8 毫秒,在 AMD MI325X 上為 9 毫秒;在 Jetson AGX Thor 上為 16 毫秒,在 Jetson AGX Orin 64 GB 上為 26 毫秒,在最小的 Jetson Orin Nano 上為 50 毫秒,在 Apple M5 Pro 上則為 30 毫秒。將六十四個狀態打包進單一執行趟次,在 4090 上達到每秒 475 次。

• 缺少了什麼——d1-omni-600M 完全沒有推論表。Liquid 表示它正在積極開發中,因此根本不報告其延遲。整個發布版本中也沒有任何音訊決策基準,因為用供應商的話來說,專用的音訊決策基準目前是一個未解的問題。

新聞稿真正提出的主張

在權重上線的兩天前,Liquid 發布了此模型的託管版本,並在六項應用程式上讓它與 GPT-6.1 Sol 和 Claude Opus 5.5 對測。其摘要指出:d1 在六項中的四項上與 GPT-6.1 Sol 相當或勝過它,成本低 19 倍到 200 倍,且在每項任務上都回答得更快。在轉述任何上述內容之前,值得先閱讀已發布的方法論——每項應用程式於 2026 年 10 月 5 日對每個模型各執行一次,聊天模型以其預設推理設定以 JSON 回答,而 d1 的成本是以每百萬個輸入 token 0.04 美元計算。

示範是更有說服力的那一半。從四條產線——電路板、蠟燭、腰果、口香糖——分揀良品與瑕疵品,準確率達 85% 到 97%,而且靠的是一個從未為這項任務訓練過的模型,只憑一段簡短描述就理解了任務。一個 SQL 述詞,為 150 張支援工單逐一回答是或否。一個情境壓縮迴圈,會讀取編碼代理工作階段中的每一項工具輸出,並決定保留、裁剪或捨棄,移除了 52% 的 token,同時保留任務所需的每一項輸出。在 Tetris 中,把畫面加入一個完全可用文字描述的遊戲,讓分數從消除 70 行提升到 81 行——這是純文字分類器無論多優秀都得不到的視覺結果。

那些是供應商自行進行的示範,任務也由供應商挑選,而方法論一節也如此說明。它們依然是任何人已發表過、有關決策模型用途的最清晰描繪。

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57, and its latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

在哪裡執行,以及呼叫需要多少費用

開放權重是為在本地執行而打造,廠商也事先完成了整合工作:首日即支援 llama.cpp、從 DGX 一路到 Jetson 的完整 NVIDIA 技術堆疊、NVFP4 量化,以及與基礎檢查點一同發布的 8 位元權重/活化變體。GGUF 轉換檔已經在 Hugging Face 上。如果你不想自行託管任何東西,Liquid 提供代管的d1,並透過自家 API 提供服務——僅收輸入 token 費用,不收輸出 token 費用;圖片則以輸入計費,每個 32×32 像素區塊 1.5 個 token,換算下來,一張 1024×1024 圖片就是 1,536 個 token。純文字存取也可透過第三方平台取得。

誠實的路由說明:Liquid AI d1-3B 與 Liquid AI d1-omni-600M 都不在我們的目錄中,而本文也不是針對其中任一者的可用性聲明。d1 這對模型為路由器帶來的改變,是圍繞它的管線樣貌。一個能在毫秒內回應、且不耗費輸出 token 成本的決策模型是篩選器,不是替代品——良品與瑕疵品分類以及工單分診發生在生成式呼叫之前,而生成式呼叫正是單一端點橫跨 200+ 個模型、以 0% 加價原樣傳遞的標價,以及 自動容錯移轉真正發揮價值的地方。不同層級,同一條管線。

什麼能平息這場爭論

有三件事懸而未決,而這三件都是唯有時間才能了結的那一種。

第一項是獨立重現。Decision Index 的數字是由廠商以官方評分器產生的,而每個競爭對手的欄位都是從公開排行榜上取下來的;這是站得住腳的方法,但和由第三方實際跑你的模型並不是同一回事。第二項是音訊。一個能在單次前向傳遞中路由語音指令的 600M 檢查點,是真正全新的能力,而目前並不存在任何能衡量它做得有多好的基準測試。第三項是類別本身:當答案是從分布中讀取而非逐字寫出時,小模型常見的失效模式——循環、漂移、拒答、幻覺出格式——根本不可能發生,而沒有人發表過關於什麼取代了它們的完善說明。校準誤差是顯而易見的候選項,而這正是每個答案上的信心欄位邀請你自己去測量的東西。

十個 demo 在公開的 Hugging Face Space 上,以迴圈方式對即時攝影機輸入執行 Liquid AI d1-3B,這是形成你自己看法最便宜的方式。權重免費,而問題很具體。這比今年大多數發布版本所提供的起點都更好。

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新