
Liquid AI d1-3B 與 Qwen 3 8B:8B 分類工作負載是否應該轉向決策模型?
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
在大多數生產堆疊中的某個地方,都有一個 Qwen 3 8B 被用來付費回答是或否。它會審核留言、標記支援工單、判斷檢索到的段落是否相關,或依據評分標準為另一個模型的輸出打分——而它是靠生成文字來做到這件事,接著再由下游的某個東西解析。Liquid AI d1-3B 是 Liquid AI 於 2026 年 10 月 7 日開放權重釋出的 3.12B 決策模型,它的存在正是為了在完全不生成任何東西的情況下完成這項工作:一個狀態輸入、一組具名問題輸入,並在單次前向傳遞中以零輸出 token 輸出機率、標籤與信心分數。Qwen 3 8B 則是該廠商 2025 年 4 月的開放權重主力模型——約 8.2B 密集參數、119 種語言、可依每次請求開啟或關閉思考,且已有十六個月的社群部署經驗。這組搭配實際上提出的問題狹窄而務實:對你流量中屬於分類的那一部分而言,在 2026 年,8B 通用模型是取得標籤最便宜的方式嗎?還是這項工作的形態已經在其腳下改變了?
你實際上花錢請一個 8B 去做的事
把兩份輸出契約並列來看,這種低效率是結構性的,而非漸進式的。
Qwen 3 8B 的分類呼叫就是一次生成。你寫一段提示詞描述標籤,模型會視情況對輸入進行推理——而在這個模型上,你可以針對每次請求開啟或關閉那項推理,這是它在這類工作上最有用的一個旋鈕——然後它會回寫一個答案。那個答案就是文字。如果你要求 JSON,通常就會拿到 JSON,但偶爾你會拿到夾在句子裡的 JSON、或是開場白、或是你根本不想要的結尾說明。你在乎的那個標籤就在詞元串流的某處,由解析器把它取出來。模型寫出的每一個詞元都會計費,包括你丟掉的那些。
Liquid AI d1-3B 沒有 token 串流。問題會以類型宣告:noul 用於是/否,回答為介於 0 與 1 之間的 P(yes);choice 用於從具名選項集中選出一個標籤,回答為該標籤加上信心值,再加上每個選項的機率;score 用於有序二到十量表上的位置,回答為期望等級及其分佈與圖例。回應帶有一個累計總數,顯示為 output_tokens: 0。沒有東西需要解析,因為沒有寫入任何內容,而且當你想要未四捨五入的分佈而非 argmax 時,有一個原始的 probabilities 存取器。
影響你帳單的部分,在於同時處理多個問題時會發生什麼事。一個狀態可以承載許多問題:這是不是退款請求、該由哪個團隊負責、它有多急迫。狀態及其影像只會被讀取一次,而 Liquid 回報,在單一狀態上跑三個問題,所耗時間是一個問題的 1.3 倍,而非 3 倍。它沒有壓縮掉的是輸入費用——供應商的計費說明明確指出,每個問題都以其自身的提示計費,包括其文字與所有影像。更低的延遲,相同的輸入 token 數。這是對宣傳標語的一個誠實註記,而這種事你只能靠閱讀定價段落、而不是看基準測試才會發現。

十六個月的 Qwen 3 8B 能為你換來什麼
在把較小的模型視為升級之前,要先確切了解現有模型帶來什麼,因為那不只是參數數量。
• 上下文 — Qwen 3 8B 原生執行 32,768 個 token,並經 YaRN 驗證可延伸至 131,072。Liquid AI d1-3B 則固定執行 32,768 個 token,且沒有文件記載的延伸途徑。對於一個由長文件構成的狀態,8B 是兩者中唯一能容納它的。
• 語言 — Qwen 3 8B 有 119 種語言和方言,相較於 Liquid AI d1-3B 的十六種已記錄語言。
• 推理控制 — Qwen 3 8B 讓你能針對每次請求開啟或關閉思考。Liquid AI d1-3B 沒有可控制的推理模式,這究竟是簡化還是限制,取決於你原本打算用思考來做什麼。
• 廣度——8B 會撰寫、解釋、摘要、翻譯和寫程式。Liquid AI d1-3B 這些都不會。它的模型卡說得很明白:它不是聊天模型,也不會撰寫文字。
• 證據 — Qwen 3 8B 已有十六個月的公開基準測試、量化、微調與正式生產使用紀錄。Liquid AI d1-3B 的 Decision Index 分數 48.57 是由 Liquid 使用官方評分器產生,而非提交至公開排行榜;且該分數僅發布數日,尚無第三方重現。
• 視覺 — 這一列的方向相反。Liquid AI d1-3B 可接收影像,廠商回報在十一項公開影像基準測試中,以各基準選項集所做的決策來判讀,取得 74.1,並回報若移除影像,同樣問題會驟降至 45.1。純文字的 Qwen 3 8B 若要做到任何這類事情,前方需要一個獨立的視覺模型。
• 速度 — 在 RTX 4090 上一個問題只需 8 毫秒,在 Jetson AGX Thor 上為 16 毫秒,在 Jetson Orin Nano 上為 50 毫秒,而在 4090 上每次傳遞可處理 64 個打包狀態、每秒 475 次。基於生成的分類器沒有可相比的數字,因為其延遲取決於答案有多長。
誠實的總結是:8B 是更好的通用工具,而 3B 決策模型是更好的專用工具;唯一真正重要的問題是,你的流量中有多少屬於專用案例。
成本計算,審慎為之。
這正是比較能否回本的地方,因此值得用真正的架構來進行,而不是一句口號。
Liquid 在開放權重版本發布兩天前所發布的說法是,其託管決策模型在六個真實應用中的四個上,與 GPT-6.1 Sol 持平或勝過它,成本低 19 倍到 200 倍,而且在每項任務上都回答得更快。在轉述之前請先閱讀方法論:每個應用在 2026 年 10 月 5 日對每個模型各執行一次,聊天模型以其預設推理設定以 JSON 作答,而 d1 的成本是以每百萬輸入權杖 0.04 美元計算。那個 0.04 美元的數字是託管 d1的輸入費率,而且它是唯一存在的費率——沒有輸出費用項目要加。
現在為 Qwen 3 8B 分類器建立同樣形狀的估算,這種不對稱就顯而易見,無須引用任何供應商的價格。8B 有兩條可計費項目,而決策模型只有一條,且第二條正是會增長的那一條:先進行推理的分類會為推理付費,而填充其 JSON 的分類會為填充付費。決策模型的輸入費用由狀態與問題固定。8B 的輸入費用則無法由任何單憑狀態即可預測的因素來固定。
有兩股制衡力量讓這件事不至於變成一場潰敗。首先,決策模型會把每個問題都當成各自獨立的提示來計費,所以針對一份長文件問五個問題,會讓輸入變成五倍——8B 則在一次呼叫中問完這五個問題,而且只需為該文件付費一次。其次,而且影響更大的是,決策模型只能回答它在後訓練時被訓練成能以那種形式回答的問題。任何需要以文字表達的解釋、摘要或判斷,都會讓你回到通用模型,而且實際上,也回到兩邊都得付費的情況。

這兩個真正擅長的事
把基準測試剔除掉,這個分界會比參數量所暗示的還要更乾淨。
Liquid AI d1-3B是為了是/否、從清單中挑選以及評分而設計,其延遲下限是任何生成式模型都達不到的,且硬體涵蓋 50 毫秒的 Jetson Orin Nano 與筆電。Liquid 在十月展示的應用全都是同一種形態的版本——一個 SQL 謂詞為 150 張支援工單回答是或否;一個代理上下文壓縮迴圈,會保留、修剪或捨棄每個工具輸出,並移除 52% 的 token;一個檢測應用在四條產線上分揀良品與瑕疵品,在它從未受訓、且僅從簡短描述就理解的任務上達到 85% 到 97% 的準確率。最後那個展示最清楚地說明了這個類別的用途:一項答案只是少數幾種可能之一、狀態是一張影像,且從未要求任何解釋的工作。
Qwen 3 8B 適合用於必須以語言形式回傳、涵蓋 119 種語言、能容納超過三萬二千個 token 的文件,或在定案前先出聲推理的工作。當分類不屬於上述三種型態之一時,它也是正確答案——當標籤集是開放式的、當判斷標準細緻到你需要那段思考、當同一次呼叫必須處理簡單與困難案例,而你不需要在兩個模型之間分流時。當評審問有哪些獨立基準測試時,它也是穩妥的選擇,因為答案是:很多,最早可追溯至一年半前。
把事情做對的團隊不會二選一。他們把決策模型放在通用模型前面,只用在答案是個數字的那部分流量上,並讓 8B 處理所有需要以句子表達的內容。過濾器是 3B、8 毫秒;8B 則保留給實際內容。
部署此配對
Liquid AI d1-3B 以權重形式推出,部署工作早已就緒:首日即支援 llama.cpp、從 DGX 一路到 Jetson 的完整 NVIDIA 技術堆疊、NVFP4 量化、8 位元權重與活化值變體,以及在 Hugging Face 上的 GGUF 轉換檔。Qwen 3 8B 擁有此權重級別中任何模型最深厚的自架生態系。兩者皆不在我們的目錄中,本文所述也不構成對其中任何一方的供應可用性聲明——Liquid AI d1-3B 的託管途徑是供應商自家的 API 與第三方平台,而在這些平台上,託管的 d1僅依輸入 token 計價,每百萬個 0.04 美元,圖片則以每 32×32 像素區塊 1.5 個 token 計費。
一旦兩者都進入同一條管線,路由問題就不再是理論問題。你有一個自己擁有的小型模型、一個你可以自行託管或租用的 8B 模型,以及你肯定得租用的生成式呼叫——而針對每個請求決定某個給定輸入該打中哪一個,正是路由層存在的目的。單一端點橫跨 200 多個模型,供應商定價以 0% 加成原樣傳遞,因此供應商的價格變動當天就會在你這邊生效,自動容錯移轉,因此上游的一個糟糕下午不會變成你的服務中斷。當你的分類流量以每年數十億次呼叫計算時,那個層級才是 3B 決策模型所帶來的節省真正被收穫的地方。
裁決結果
如果你的 8B 是被拿來回答封閉式問題——這有毒嗎、這相關嗎、這該歸入哪個佇列、這有多急迫——你是在為了一個標籤,付出通才模型兩行輸出的代價,以及一次生成的延遲,而 Liquid AI d1-3B 是個直接替代品,但有較弱的證據鏈和實質的授權差異需要權衡。接受 32K 上下文上限、這十六種語言,以及 Liquid 之外還沒有人給它評分的事實。
如果你的 8B 被要求進行解釋、摘要、翻譯、記住長篇文件,或在做決定前先推理,那麼這項比較並不適用於你。請保留 8B,並只把決策模型視為前置篩選器,用於你能事先辨識為簡單類型的那類流量。
真正值得留意的數字,不是任一模型的基準測試成績,而是 d1 Decision Index 首次獨立重現的速度,因為那一刻起,這項比較就不再是廠商的說法,而開始成為你可以據以規劃的事實。

