
DeepSeek V4.1 Flash 在 OpenCode 中:設定、成本,以及沒人提及的努力旋鈕
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 151 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 251 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
DeepSeek V4.1 Flash 自 9 月 10 日起就一直待在 OpenCode Go 裡,而 OpenCode 為它附加的倍率有公布結束日期:9 月 20 日。也就是四天後。有趣的地方不是這個期限,而是決定這個模型寫起程式順不順手的那項設定,在搜尋結果第一頁的每一份設定指南中都找不到,而且在至少兩個測試框架裡它被默默丟棄。這是一份實戰指南,教你如何把編碼代理指向 DeepSeek V4.1 Flash:確切的模型 ID、今天驗證過的三種整合、社群回報的推理強度控制,以及過度思考的失敗模式與真正有效的緩解措施。
你實際上讓你的代理指向什麼
DeepSeek V4.1 Flash 於 2026-09-10 推出——DeepSeek 自家 API 文件上的發行說明標註的正是當天日期,而它是該廠商新架構系列中最小的模型。DeepSeek 表示,其 552B 參數的混合專家主幹建構於其所稱的 Causal Encoder–Decoder 設計之上,在預填期間每個 token 約啟用 8B 參數,在解碼期間則啟用 16B。它接受文字與圖像作為輸入並傳回文字,支援最高達一百萬個 token 的上下文視窗,並能在單一回應中產生最多 384,000 個 token——上下文與輸出上限皆來自 OrcaRouter 為該模型設立的自家模型頁面,該頁面分別列出 1,048,576 與 384,000。
廠商自報的基準測試成績,來自 DeepSeek 發布頁面上的圖表,因此屬於廠商自行呈報、未經審計的數據:Terminal-Bench 3.0 為 30.0,DeepSWE v1.1 為 74.2,CyberGym 為 88.1,Automation-Bench 為 54.8,GPQA Diamond 為 90.9。獨立評測雖然較為稀少,但確實存在——今天直接查閱 Artificial Analysis,其 Intelligence Index 給 DeepSeek V4.1 Flash 打出 40 分,在其比較類別中於 113 個模型裡排名第 6。同一頁面上有一行資訊,對 coding-agent 讀者而言比排名更重要:Artificial Analysis 將該模型標為非常冗長,它在完成 Intelligence Index 測試時消耗了 2.5 億個輸出 token,而中位數為 1.4 億。我們之後會再回到這一點。
兩項命名事實能節省實際的除錯時間。DeepSeek 的標準 API 模型 ID 現在是 code>deepseek-flash/code>。較舊的字串 code>deepseek-v4-flash/code> 與 code>deepseek-v4-flash-vision-exp/code> 仍可接受,但其背後的模型已退役,請求會由 V4.1 Flash 以 Flash 的價格提供服務。另外,DeepSeek V4 Pro 並未消失:DeepSeek 的說明文件指出,V4 Pro API 服務在 2026-09-14 之後仍會持續,且計費維持不變。如果有人告訴你旗艦已被停用,那並非廠商自己的說明文件所說。

OpenCode:兩種進入途徑,以及真正該輸入的 id
要將 DeepSeek V4.1 Flash 架在 OpenCode 背後有兩種做法,而兩者的成本效益各不相同。
訂閱方案是 OpenCode Go,這是每月 10 美元的方案,OpenCode 將其描述為一組精選的開放式程式設計模型,並經過測試與基準測試。設定只要四個步驟,而且沒有需要手動編輯的設定檔:登入 OpenCode Zen、訂閱 Go、複製 API 金鑰,然後執行code>/connect/code>,在 TUI 中選擇 OpenCode Go,並貼上金鑰。之後code>/models/code> 會列出可用項目。設定中的模型參照格式為code>opencode-go/<model-id>/code>。
哪個模型 ID?兩者皆是。Go 閘道自身的模型清單,今天從 code>https://opencode.ai/zen/go/v1/models/code> 取得,會回傳 code>deepseek-flash/code> 與 code>deepseek-v4.1-flash/code> 這兩個各自獨立的項目,並與舊有的 code>deepseek-v4-flash/code> 及 code>deepseek-v4-pro/code> 並列。前兩者中的任一個都能解析到你要的模型;code>deepseek-flash/code> 是標準名稱,對於任何你打算持續執行的項目而言是更安全的選擇。
直接路徑完全跳過訂閱:執行 code>/connect/code>,搜尋 DeepSeek,然後貼上 DeepSeek 平台金鑰。接著你將由 DeepSeek 按定價計費,而不是動用 Go 的額度。DeepSeek 公布的定價為離峰時段每 100 萬輸入權杖 $0.15、每 100 萬輸出權杖 $0.60,快取讀取為每 100 萬 $0.003——而在尖峰時段則正好是這些價格的兩倍。無論是 OpenCode Go 的文件,還是 OrcaRouter 的模型頁面,今日查閱時都同意這些數字。
OpenCode Go 額外提供的是額度結構,而這裡的數字值得仔細解讀,因為它們正是這個期限之所以重要的原因。OpenCode 自家的文件列出 DeepSeek V4.1 Flash,每月上限為 15 美元,目前在 OpenCode 標示為「9 月 20 日結束」的促銷活動下乘以 4 倍至 60 美元。預估請求次數以兩欄公布:標準費率下為每 5 小時 6,500 次/每週 16,250 次/每月 32,500 次,或者套用 4 倍倍率後為 26,000/65,000/130,000。額度的形態在各模型之間一致——5 小時上限是每月數字的 20%,每週上限是 50%,而每月上限就是全部。
那些是 OpenCode 公開的數字,是今天從其 Go 說明文件讀取的。那項促銷活動由他們決定何時結束,而且是有期限的。

Command Code:仍在運作,還有一份值得一看的錯誤回報
Command Code 自家的產品目錄截至今日仍將該模型列出,id 為code>deepseek-v4-1-flash/code>,具備 1M token 的上下文視窗,以及同樣的價格轉嫁模式:離峰時段 $0.15 / $0.60,尖峰時段 $0.30 / $1.20,快取讀取 $0.003。兩個獨立測試框架的價格完全一致絕非巧合——雙方都是直接沿用 DeepSeek 的定價,而非自行訂價。
機制很簡單。使用以下指令安裝:code>npm i -g command-code/code>,從你的專案目錄執行它,並使用 code>/login/code> 進行驗證,並使用 code>/connect/code>,如果你想自備供應商金鑰。code>/model <id>/code> 會直接套用模型變更,而單獨輸入 code>/model/code> 會開啟選擇器,code>/effort/code> 則會設定目前模型的推理強度——這裡最重要的旗標。
在你開始除錯錯誤的層級之前,有一則社群錯誤回報值得先記在腦海裡。一個針對第三方路由層的未解決 issue 描述了某個推理重播快取,對 code>command-code/deepseek-v4.1-flash/code> 這個 id 永遠不會啟用,因為路由層用來比對的模式預期的是 code>v4./code> 或 code>v4-/code> 區段,而該字串是 code>v4.1/code>。回報的症狀是上游 400 錯誤,抱怨在 thinking 模式中產生的推理內容必須傳回 API。那是一則關於用戶端比對器的社群錯誤回報,不是廠商指引,也不是模型的問題——但它正是那種在凌晨兩點會看起來像模型故障的東西。
Claude Code、Codex,以及 OpenCode 本身已驗證的用戶端
OpenCode Go 並非僅限 OpenCode 使用,而他們的文件也明確如此說明:它是為 OpenCode 以及其他會產生類似請求模式的程式開發代理所設計,並公布了一份經驗證可運作的客戶端清單。該清單目前列出 Hermes、Claude Code、Codex、ZCode 與 Pi——而針對 Claude Code 的說明是,它「能辨識其原生工作階段標頭,不需要自訂標頭的包裝層」。隨之而來有兩項要求:以自己的 user agent 而非通用 SDK 名稱來識別你的客戶端,並在每次對話的 code>x-opencode-session/code> 標頭中送出穩定的工作階段識別碼,這正是讓他們的路由與提示快取得以運作的關鍵。對 Hermes 而言,經過驗證的建置版本很重要——該標頭修正是在 v0.21.0 之後才合併,因此單憑那個版本並不包含它。
還有一種完全不需要訂閱的方式,直接使用 DeepSeek 的 Anthropic 相容端點。設定 code>ANTHROPIC_BASE_URL/code> 設為 code>https://api.deepseek.com/anthropic/code>,code>ANTHROPIC_AUTH_TOKEN/code> 設為你的 DeepSeek 金鑰,並將模型變數指向該模型。Claude 模型名稱在傳入時會重新對應:任何開頭為 code>claude-opus/code> 都會對應到 DeepSeek V4 Pro,並以 V4 Pro 的價格計費,而 code>claude-sonnet/code> 與 code>claude-haiku/code> 名稱會對應到 Flash 模型。這個 code>[1m]/code> 在模型字串上的後綴會要求百萬權杖上下文的變體。DeepSeek 針對此設定的官方指南也會設定 code>CLAUDE_CODE_EFFORT_LEVEL=max/code>,並將自動壓縮視窗固定為 786432 個權杖。
最後那個變數就是社群修正方案所在之處。會有變通代理,是因為近期的 Claude Code 版本會送出code>thinking: {"type": "disabled"}/code> 於子代理請求中,而code>CLAUDE_CODE_EFFORT_LEVEL=max/code> 會加入一個推理強度參數,且 DeepSeek 的 Anthropic 格式端點會拒絕這個組合,並回傳一則訊息,表示在設定了推理強度時,thinking 選項無法被停用。所回報的變通方法範圍很窄——僅從子代理請求中移除 effort 參數,主代理則保持不變。將其視為關於用戶端/伺服器契約不符的社群發現,並預期確切的版本分界會變動。
努力刻度盤:1–100,以及為什麼「低」代表 50
本節中的所有內容都是社群發現,而非廠商指引。DeepSeek 並未發布我們能驗證的預設項目與數字對應關係,而下列數字來自實務工作者的文章與第三方評測框架文件。它們在各來源之間足夠一致,因此有參考價值;但也足夠未經證實,所以你應該在自己的工作上測試它們。
DeepSeek V4.1 Flash 以 1 到 100 的連續推理努力純量進行訓練。它不是 token 上限——而是移動模型在訓練過程所學到的曲線上的位置,其中較低的努力會施加更多壓力以保持簡潔,而較高的努力則讓額外推理變得更便宜。三個公開預設值對應到這個尺度:
• 低 — 50,路徑最短,也是讓這個控制項背上廉價惡名的預設值。
• 高 — 75,也是多數社群來源所描述代理工作的合理上限層級。
• Max — 100,其中對推理長度的懲罰會完全移除。
這個旋鈕所換得的效益確實存在,但衰減得非常明顯。有一項社群基準測試掃描報告指出,把 effort 從 25 調高到 100,能讓 Terminal-Bench 2.1 從 82.4 提升到 90.6,但整體輸出 token 數大約會變成 2.5 倍。各方報告一致指向 effort 落在 60 到 80 之間,就能以不到一半的 token 預算取得大部分可得的準確率;而開到最大會讓 agent 軌跡再增加 1.6–1.8 倍,換來的增益卻很有限。
預設值是最沒有共識的部分。有些測試框架文件與實務人員報告指出,未設定的 effort 會解析為 high;另一些則將伺服器預設值描述為單純未知。有明確文件記載而非仍有爭議的是,有兩個測試框架整合被發現完全沒有送出該參數——OpenCode Go 供應商設定檔與原生 DeepSeek 設定檔都略過了送出 code>reasoning_effort/code> 的 code>deepseek-flash/code> slug,因為它們的比對防護條件預期會有 code>deepseek-v…/code> 前綴,而標準 ID 並沒有這個前綴。在這兩種情況下,使用者選擇的設定都被供應商預設值悄悄取代。如果你的用戶端顯示了 effort 控制項,那並不代表它真的有送出。記錄一個請求主體並查看。
同一批報告還有一個怪癖:OpenCode Go 端點接受 code>low/code>、code>medium/code>、code>high/code> 與 code>max/code>,但會拒絕以整數表示的 effort——據回報,填入 80 會回傳 HTTP 400。模型內部確實存在 1–100 的刻度,但並非在所有地方都以原始數字形式暴露,因此「把 effort 設為 65」在你的用戶端中未必能表達得出來。
過度思考的失效模式,以及真正能修復它的方法
這是一種失效模式,決定你是否會把模型留在你的工作流程中。社群回報描述 DeepSeek V4.1 Flash 在工作完成後仍持續推理:重新爭辯一個它已經正確回答的論點、敘述自己如何修正錯誤假設,並產生資訊密度低的長推理鏈。有一位實務工作者回報,在一個程式設計 CLI 工作階段中,推理輸出持續超過一小時。另一位則回報,完全無法讓它完成一次長時間的基準測試執行。
關於第二份報告的來源說明,因為這類說法最容易被洗白。它出自一個討論如何穩定運行該模型的社群討論串,而 Reddit 會封鎖我們的抓取程式,所以我們無法直接讀取該討論串——我們是轉述這份報告,而不是引述我們實際開啟過的頁面。我們能獨立驗證的是問題的輪廓,而在這一點上,外部證據異常乾淨:Artificial Analysis 在自己的頁面上指出,該模型極為冗長,完成一次運行要消耗 2.5 億個輸出 token,而其中位數比較模型只需 1.4 億個就能完成。這大約是 1.8 倍,由第三方在固定任務集上測得。論壇上的回報與這項獨立指標描述的是同一種行為。
那些報告所產出的緩解措施,全都來自社群:
• 將 effort 固定在 high 或更低,並且不讓它棘輪式上升。實際環境中最明確的修正,是一個專門用來阻止 effort 升級的路由外掛:回合深度對升級分數沒有任何貢獻,只有失敗的工具結果或完全相同的重試才會計入,升級有上限,而 max 需主動選用且預設被降級。如果你的 harness 允許 agent 在執行時間拉長時自行提高 effort,那就是該關掉的機制。
• 不要將 max 作為預設執行。多位從業人員回報,max 會不斷空轉,而無法在例行工作上收斂;切換回 high 即可解決。
• 設上限:code>max_tokens/code> 於互動路徑。384,000 個 token 的輸出上限是一種限制,而非目標;而一個不會終止的迴圈在那樣的上限下代價高昂。
• 驗證該參數確實有被送出。既然發現有兩個測試框架會默默將它丟棄,「我把它設為 high」和「high 有送達 API」是不同的說法。
• 測試框架的重要性超乎你的預期。使用相同權重的從業者回報,在不同外殼之間行為差異極大——同一個模型在某個測試框架中會自相矛盾、把訊號埋沒,換到另一個框架卻完全沒有人提出這些抱怨。這是社群對測試框架行為的觀察,不是廠商對該模型的宣稱,但它是這些報告中最常被重複的一條建議。
以這些費率計算,一個編碼迴圈實際上要花多少成本
DeepSeek 的定價是離峰時段每 100 萬個輸入 token 收 0.15 美元、每 100 萬個輸出 token 收 0.60 美元——輸出是輸入的四倍,這是認識一個既能生成推理、也能生成程式碼的 agent 時,首先該內化的觀念。
以一個真實的 agent 回合為例:輸入 60,000 個 token 的上下文(系統提示、工具結構定義、儲存庫切片、對話歷史),輸出 3,000 個 token 的推理外加一個修補程式。也就是輸入 60,000 × $0.15/1M = $0.009,加上輸出 3,000 × $0.60/1M = $0.0018,所以每回合大約 1.1 美分。一個工作日裡兩百個這樣的回合大約是 $2.16,而以離峰費率計算,一整個月的平日加起來約為 $47。正是這樣的算術,讓每月 $15 的額度再加上 4× 促銷顯得很大方——也正是這樣的算術,讓冗長成為最該留意的事。
因為這就是隱藏在 Artificial Analysis 那個數字裡的槓桿。模型在固定任務集上使用的中位輸出 token 數的 1.8 倍,意味著一個受輸出限制的迴圈,成本會是單看 token 價格所推估的 1.8 倍。而 effort 調節鈕正是控制這件事的關鍵。社群回報指出,把 effort 從 max 調降到 high,輸出 token 大約會減半——這比 peak/off-peak 時段排程對你造成的任何波動都大得多。effort 設定是那根大槓桿;時段排程則是免費的那一根。
在安排任何事之前,有件事值得先知道:尖峰時段是 UTC 週一至週五的 01:00–04:00 與 06:00–10:00,其他所有時間(包括週末)都是離峰時段。一個在 09:00–18:00 CET 工作的歐洲團隊永遠碰不到尖峰。一個在北京同樣按當地工時上班的團隊,則會從 09:00–12:00 和 14:00–18:00 撞上尖峰——九個工作小時裡有七個是兩倍價格。同樣的模型、同樣的程式碼,帳單卻翻倍,完全由時區決定。
另一項免費的節省來自快取讀取費率,每 100 萬個詞元收 $0.003,相較於全新輸入的 $0.15——只有五十分之一。程式編寫代理的提示大多是可穩定重複的前綴:系統指令、工具定義、儲存庫中不會變動的部分。把穩定不變的內容放在最前面,讓變動的內容跟在後面,供應商端的快取就會處理其餘的部分。快取輸入是否享有折扣、以及在什麼條件下適用,是由 DeepSeek 而非用戶端決定的,所以在據此編列預算之前,請先查閱目前最新的文件加以確認——我們自家關於 code>deepseek/deepseek-v4.1-flash/code> 的模型頁面也是這麼說的:快取輸入的費率依供應商的條款而定。
如果你不想為了評估這個模型而新增第二個訂閱,同樣的 id 可透過 在我們整個型錄前方的一個 OpenAI 相容端點取得,並以供應商的費率搭配0% 加成—— 因此 DeepSeek 端的價格變動會當天在這裡生效,而不是等到下一次重新定價。這對本文所描述的情況最為重要:一個有明確紀錄顯示會傾向於持續運作,且位於你尚未完成評估的路徑上的模型。備援鏈意味著,出錯的一回合會在回應開始前改由另一個模型接手,而不是讓請求失敗。
552B、748B 或 763B——規模問題確實仍未定論
不要將這個模型的參數數量當作定論來複述,因為目前流傳著三種不同的數字,而它們沒有一個是單純錯誤的。
DeepSeek 自家的模型卡描述了一個「552B 主幹參數」模型,而那是廠商回報的數字——它也是我們自家模型頁面上規格面板所載的數字。同一張模型卡另外列出一個 196B 參數的「Engram 條件式記憶」模組,「透過基於 token 的查找進行稀疏存取」。把兩者相加得到 748B,這正是社群分析在發布後數小時內得出的算術結果。而同一個模型儲存庫上的檔案中介資料列出模型大小為 763B 參數,這又是第三個數字。
表面上的爭議是定義之爭,而非矛盾。查表取得的 Engram 參數會耗用記憶體,但每個 token 幾乎不涉及運算;而計算得出的主幹參數則會讓每個 token 都耗費時間——這正是廠商將兩者分開報告的原因,也是為什麼比較兩個架構不同模型的主要數字,能告訴你的東西少之又少。
真正沒有嚴重爭議的是活躍參數量:在預填充階段每個 token 約 8B,在解碼階段約 16B,而這才是實際決定推論成本的數字。權重依 MIT 授權條款開放,如果你想自行查核這一切。請把 552B 視為廠商回報的數字,把 748B 視為可信的社群總計,而任何聲稱規模問題已有定論的說法都還言之過早。

20號前該做什麼
如果你打算在編碼代理中試用 DeepSeek V4.1 Flash,最不浪費時間的順序是:先挑選測試框架,再固定推理強度,最後再測量。
在測試框架(harness)上,對今天驗證的誠實總結是:這三種路徑都能運作,但它們對你的要求各不相同。OpenCode Go 是每月 10 美元的訂閱,附帶一個將於 9 月 20 日到期的促銷倍率,而設定方式是 code>/connect/code> 加上 code>/models/code>,無需編輯任何檔案。Command Code 會在自己的目錄中即時列出模型,並以 code>/model <id>/code> 切換,且將 effort 公開為第一級命令。Claude Code 可透過 OpenCode Go 的已驗證用戶端路徑觸及它——在那裡不需要自訂標頭包裝器——或直接對接 DeepSeek 的 Anthropic 格式端點,而在後者中,子代理 effort 衝突是已知的粗糙邊緣。
關於 effort,請明確設定它,並把它設得偏低一點:設成 high,或者如果結果顯示 high 就是模型預設值,就用模型預設值,而不是 max。接著確認它已離開你的機器,因為發現有兩套測試框架會把它丟掉。
在衡量時,要看的是輸出 token,而不是牆鐘時間。冗長是成本,努力程度旋鈕是控制手段,而尖峰時段不過是時區造成的偶然,你可以免費避開。
而關於本週你會看到有人拿來對你引用的那些規模說法——552B、748B、763B——有用的回應是:廠商報告的是它的主幹,社群加上的是記憶體模組,而儲存庫中繼資料又會說出另一回事。任何把其中一個當成定論來呈現的人,是挑了一個數字,而不是查證過一個數字。
