一張標題為「Liquid AI d1-3B vs Gemma 4 12B」的主視覺標題卡,副標題為「決策模型對上通用型模型」,圖中展示了一張帶有機率標籤的小型 3.12B 檢查清單卡,旁邊是一張較大的 11.96B 卡片,帶有文件、波形與影片畫格圖示,以及一個書面答案標籤。
Guides & Insights

Liquid AI d1-3B 與 Gemma 4 12B:決策模型對上通用型模型

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

把 Liquid AI d1-3B 和 Ge​mma 4 12B 放上同一個基準測試,然後等著選出贏家,是讓這項比較出錯最快的方法。它們回答的不是同一個問題。Liquid AI d1-3B 是 2026 年 10 月 7 日以開放權重發布的 3.12B 決策模型:你給它一個狀態和一組具名問題,它會回傳機率、所選標籤和信心分數,輸出 token 數為零,也沒有生成步驟。Ge​mma 4 12B 是 Goo​gle 的無編碼器任意對任意通才模型,一個 11.96B 檢查點,可接收文字、圖像、音訊和影片,並在超過 140 種語言中,於 256,000 個 token 的視窗內寫出答案。其中一個會告訴你電路板是四種東西中的哪一種。另一個則告訴你為什麼。只比較它們的品質,你什麼也學不到,因為兩者的輸出不可共量——而且廠商從未將它們彼此做基準測試。比較一次呼叫實際回傳什麼、成本是多少,以及各自在哪裡走到盡頭,這個配對就會成為真正有用的邊界測試。

兩種不同的輸出契約

這裡真正起作用的區別,在於網路上回傳的內容。

Liquid AI d1-3B會傳回結構化答案物件。請求中的每個問題都會宣告一種類型——noul用於是/否,並帶有 P(yes),choice用於具名選項集中的其中一個選項,並帶有每個選項的信心值與機率,或score用於二到十級有序量表上的位置,並帶有預期等級及其分布。模型會回報output_tokens: 0,因為不會寫入任何內容。針對單一狀態的多個問題會在一次前向傳遞中讀取,而該狀態及其影像會為所有這些問題編碼一次。

Gemma 4 12B會回傳散文。有時它會回傳你要求的 JSON,有時它會回傳並非你確切要求的 JSON,而且它在回答前會先進行推理。它首先是一個語言模型:凡是它懂得如何分類的內容,它都會以文字表達。當答案必須向人類解釋,或餵給期待語言的後續步驟時,這是它的強項;而當你唯一需要的只是一個機率時,這便是它的代價。

下游的一切都由此而來。d1-3B 的回應不可能解析失敗。它也無法自我解釋,而模型卡直接說明了這點:它不是聊天模型,也不會撰寫文字。

證據線索的現狀

這兩個資訊的來源並不等同,而在這裡,來源比資訊本身更為重要。

• Decision Index 0.2.1 — Liquid AI d1-3B 得分為 48.57,由廠商以官方評分器評分,在 10B 以下模型中排名第一,並領先 47.11 的 Decider 35B-A3B。Ge​mma 4 12B 完全未在 Decision Index 上評分,因此此列沒有對應項。

• 推理基準測試 —— Gemma 4 12B 在 AIME 2026 上取得 77.5 分,在 GPQA Diamond 上取得 78.8 分,Codeforces ELO 為 1,659,且在推理模式下 Artificial Analysis Intelligence Index 為 22,關閉推理時為 13。Liquid AI d1-3B 沒有推理基準測試,因為決策模型不會產生可供評分的推理軌跡。

• 長上下文 — Ge​mma 4 12B 支援 256,000 個 token,且在 Goo​gle 自家的模型卡上,於 128k 的 MRCR v2 八針測試中得分 43.4%。Liquid AI d1-3B 支援 32,768 個 token。如果你的「狀態」是一份四十頁文件加上掃描檔,那麼這個差距就是整個決策的關鍵,而且差距相當懸殊。

• 視覺 — Liquid AI d1-3B 在十一項公開影像基準測試中平均得分 74.1,這些測試被解讀為對每個基準測試選項集所做的決策,而它所基於的 LFM2.5-VL-3B 主幹則為 73.9;此外,廠商報告指出移除影像會使相同問題的得分降至 45.1。Ge​mma 4 12B 的視覺能力更強且更廣泛,但報告的是生成品質,而非對具名選項的決策準確度。

• 語言 — Liquid AI d1-3B 記錄了十六種;Geama 4 12B 則超過 140 種。

• 速度 — Liquid AI d1-3B 在 RTX 4090 上回答一個問題只需 8 毫秒,在 Jetson AGX Thor 上為 16 毫秒,在 Jetson AGX Orin 64 GB 上為 26 毫秒,在 Jetson Orin Nano 上為 50 毫秒,並在 4090 上以 475 毫秒將 64 個狀態打包進一次傳遞。Ge mma 4 12B,因此其延遲取決於。

• 證據品質 — Gemma 4 12B 的結果是 Google 的,於 2026 年 6 月發表,此後已被大型社群檢驗、量化並重新執行。Liquid AI d1-3B 的結果是 Liquid 的,兩天前才發表,實驗室外無人重現。請據此解讀第二欄。

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

他們真正競爭的唯一地方

確實有重疊,而且它不在排行榜上。那就是 LLM-as-a-judge 的呼叫。

許多生產管線早已採用中型通用模型作為評估層:為這張工單的急迫程度評分、判斷這項輸出是否通過評分標準、選擇代理下一步應呼叫哪個工具、檢查檢索到的段落是否回答了問題。現今,這些呼叫大多交給生成式模型,被要求以文字形式輸出數字或標籤,而它輸出的數字是取樣器產生的任何結果,而非對你的選項集合做 softmax 的結果。那正是 Liquid AI d1-3B 接受後訓練所要取代的工作流程,而已發布的示範全都是它的變體——一個為 150 張客服工單回答是或否的 SQL 述詞、一個代理上下文壓縮迴圈,會保留、修剪或捨棄每項工具輸出,並移除 52% 的 token,以及一個視覺檢測應用程式,能從四條產線分揀良品與瑕疵品,在它從未受訓過的任務上達到 85% 到 97% 的準確率。

Gemma 4 12B 能完成上述所有工作,而且還能做得更多。它也能撰寫摘要、同時檢視 256K 的文件、以錄製的通話作為輸入,並以 140 多種語言之一回答。如果你的流程需要一份評估與一段旁白,12B 就能用一次呼叫完成兩項工作,而 3B 決策模型則負責其中一項。

界線在於上下文長度與輸出型態。長狀態、語音輸入、多種語言,或讀者預期會有的說明——Ge​mma 4 12B,毫無懸念。短狀態、固定選項集、單次請求延遲預算在個位數毫秒內,或硬性保證答案可被解析——那就是 d1-3B 那一欄,而通用型模型正為你根本不會用到的能力付出代價。

打給每一個要多少費用

這兩款模型都不在我們的型錄上,因此兩者都沒有可報的路由價格——Ge​mma 4 12B 不在我們所服務的 Ge​mma 尺寸之列,而 Liquid AI d1-3B 屬開放權重,由你自己託管,或透過供應商自家的 API 及第三方平台存取。若要了解該系列中與 Gemini 相鄰這一側的背景,我們確實有路由的兩個 Ge​mma 4 尺寸,其定價為:Ge​mma 4 26B A4B 每百萬輸入權杖 $0.06、每百萬輸出權杖 $0.33,Ge​mma 4 31B 則為 $0.13 與 $0.38,兩者皆具備 262,144 權杖上下文,並支援文字、圖像與影片輸入。其他地方為 Ge​mma 4 12B 報出的供應商定價中位數約在 $0.10 與 $0.30。

Liquid 的代管 d1只針對輸入 token 計費,每百萬 $0.04,影像則以每 32×32 像素區塊 1.5 個 token 計入輸入。因此一次決策請求完全不會有輸出 token 這一項,這正是該廠商自己拿來與規模大得多的模型相比的成本比較會落在該處的結構性原因。開放權重沒有每次呼叫的價格;你付的是硬體成本。兩者都必須和其他你呼叫的一切放在同一條管線裡,而那正是路由器存在的層級——一套 API 橫跨 200 多個模型,供應商定價以 0% 加成原樣傳遞,以及 自動容錯移轉,讓單一上游的短暫異常不至於變成你的服務中斷。那是比較之外的管線工程,而不是比較本身。

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

說真的,該怎麼決定

從答案格式出發,而不是從模型出發。如果下游系統能消費機率、標籤和信心值,而且答案集很小且已知,那麼 Liquid AI d1-3B 就不是 12B 的降級版——它是另一種工具,而延遲數字讓它成為一個類別上截然不同的部署:在 Jetson Orin Nano 上達到 50 毫秒,代表這是一台根本沒道理去跑 12B 的裝置。

如果答案必須是一個句子,或者狀態超過三萬二千個 token,或者有人要把它說出來,或者輸出語言是孟加拉語,那麼 Ge​mma 4 12B 就是兩者中唯一能勝任這項工作的,而這場比較還沒開始就已經結束了。

對大多數團隊來說,真正有用的定位是兩者並用,只是放在不同位置。在昂貴的呼叫之前放一個決策模型,負責分流、路由,以及不需要語言能力的護欄檢查;在它之後放一個通用模型,處理需要語言能力的工作。它們是同一條管線,一個是篩選器,一個是承載內容——而最能從 d1 版本獲益的團隊,正是那些已經在花 12B 回答是或否的團隊。

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.