
DeepSeek V4.1 Flash 推出為期兩天的 API 測試版:新架構、原生多模態與專業級雄心
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0247智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75程式
- obsidianQwen3.8 27B2026-08-1541智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69程式
- grokSpaceXAI: Grok 4.62026-08-1251智能77程式
- metaMeta: Muse Spark 1.22026-08-0547智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0347智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49程式
DeepSeek V4.1 Flash 出現在 DeepSeek 在對外宣布之前測試產品的地方:正式運作的 API 內,使用的模型 ID 本身自帶到期日。這個 ID——deepseek-v4.1-flash-expires-on-0910——在 DeepSeek 團隊於官方社群群組發布「中間版本」內部測試後,於 2026 年 9 月 8 日開始提供服務;ID 尾端的 0910 正是整個故事的縮影。這是一個被放進真實 API 環境的版本,供限時測試之用,預計在 9 月 10 日前後下線,而率先披露此模型的爆料者預期官方「很快就會」發布正式發表文章。這並非正式發布。目前沒有模型卡、沒有技術報告、沒有更新日誌條目;截至今晚,DeepSeek 公開的 Models & Pricing 頁面仍然只列出 DeepSeek V4 Flash、DeepSeek V4 Pro 和 DeepSeek-V4-Flash-Vision-Exp。
閱讀以下所有內容時,都應謹記該星號的含義。此處的官方管道是社群群組公告及隨附的意見回饋表單,而非發行說明。以下內容綜合了該公告、中國媒體於數小時內的相關報導,以及開發者將自己的金鑰指向該端點後的首日測量數據——廠商的說法與社群的數字皆已如實標註其性質。
今天到底發生了什麼事?
北京時間9月8日15:00左右,DeepSeek團隊向其官方社群群組表示,一個中間版本——中文稱之為「中間版本」,也就是介於中間的檢查點——已在正式版本推出前,於真實API環境中開放有限測試。任何持有DeepSeek API金鑰的人都可以呼叫它:沿用你目前的基礎URL與金鑰,並將模型名稱設為deepseek-v4.1-flash-expires-on-0910。這就是完整的存取方式——沒有另外的端點、沒有候補名單,也沒有新的主控台。
實際的操作空間相當有限。版本的後綴透露了其中的計畫:測試版『將於9月10日自動到期並下線』,也就是只有大約兩天的上線時間。每個帳號的並發請求上限為20次——相較於DeepSeek為deepseek-v4-flash公布的2,500次並發限制——這強烈暗示了它的用途:此版本是為了功能測試與評估,而不是要讓正式環境的流量指向這裡。
• 它是什麼 — 一個「中間版本」檢查點,放在正式 API 中,用於在正式版本推出前進行短期測試。
• 執行位置 — DeepSeek 自家的 API;Base URL 與金鑰保持不變,僅將模型名稱改為 deepseek-v4.1-flash-expires-on-0910。
• 多久——名稱寫著 expires-on-0910;測試預計在9月10日左右下線。
• 誰可以呼叫它 — 任何擁有 DeepSeek 金鑰的帳戶,每個帳戶 20 個並發請求。

Beta 版的收費:DeepSeek V4 Flash 費率表
DeepSeek 表示,該測試的計費費率與 deepseek-v4-flash 相同,且該模型目前的價目表即為適用的價目表。自 2026 年 8 月 16 日重新定價以來,DeepSeek 採用尖峰/離峰定價;確切數字以 Flash 等級的官方數字為準:
輸入,快取命中 — 離峰時段每 100 萬個 token 為 $0.007,尖峰時段為 $0.014
• 輸入,快取未命中 — 離峰時段每 1M tokens 0.22 美元,尖峰時段 0.44 美元
• 輸出 — 離峰時段每 1M tokens 為 $0.66,尖峰時段為 $1.32
• 尖峰時段 — 週一至週五 01:00–04:00 與 06:00–10:00(UTC);其餘所有時段均為離峰時段,費率為尖峰時段的一半。

注意沒有改變的是:每 token 的價格。因此,DeepSeek 宣稱 V4.1 Flash「成本更低」其實是效率方面的說法,而非降價——這是幾位首日測試者付出了昂貴代價才得出的結論。他們看著五分鐘的會話從餘額中扣掉的金額,明顯比 DeepSeek V4 Flash 在同一段實際時間內消耗得更多,因為這個模型花費 token 的速度快得多。每項任務的實際成本是否真的下降,取決於它能否用更少的 token 和更少的重試次數完成工作,而這不是任何人能從兩天的速度測試中判斷出來的。
「新架構、原生多模態」的含義——目前為止,仍未經證實
DeepSeek 官方對 V4.1 Flash 的描述提出了四項宣稱:新的模型結構、原生多模態支援、更強的能力,以及更快的生成速度。其中架構宣稱格外突出,因為它打破了既有模式。上一次的更新 DeepSeek V4 Flash 0731 是在預覽版基礎上進行的後訓練更新,保留了相同的架構與規模;DeepSeek 此番措辭指向結構性改變,多家媒體因此解讀為該模型是重新預訓練而非微調。除此之外,一切皆屬推論。社群中關於注意力機制、專家網路或整合視覺模組改變的猜測,僅止於猜測。目前尚未公布任何參數數量、上下文視窗數據、基準測試表或技術報告。
「原生多模態」這個措辭之所以重要,有其特定原因。DeepSeek-V4-Flash-Vision-Exp 於 8 月 21 日推出,並自 8 月 31 日起開放權重;它是在 DeepSeek V4 Flash 文字模型的基礎上外接一個視覺編碼器——DeepSeek 自家的資料將這組合描述為「文字模型加外部視覺路徑」。V4.1 Flash 則被描述為從根本起即為多模態,影像與文字輸入由基礎模型本身處理。原則上,這確實是架構上的實質差異,但模態規格尚未公布:測試者實際執行的是文字加影像,因此在模型卡出現之前,讀者應僅在「文字與影像」這個意義上將「多模態」視為已獲證實。至於更廣泛的輸入集是否在規劃之內,截至本文撰寫時仍是未知,而非已證實。
速度是重點 — 而這是社群量測
第一天流傳的數字是:長文本生成中每秒約輸出 420 個 token,個別執行的峰值回報可超過每秒 500 個 token。一個廣為流傳的測試在不到三分鐘內產生了超過 71,000 個 token。這些都不是官方數據:這些是開發者針對 beta 端點、在不受控的條件下所做的量測,而 DeepSeek 並未發布任何自己的速度基準。作為對照,Artificial Analysis 量測公開的 DeepSeek V4 Flash 0731 端點,速率約為每秒 128 個 token,因此早期報告顯示原始吞吐量躍升約三倍或以上——但通常要提醒的是,吞吐量取決於輸入長度、並發數量和伺服器情況。
與 DeepSeek-V4-Flash-Vision-Exp 的端到端比較是差距最明顯的地方,因為它們是連續衡量同一任務。測試者回報,在 SVG 程式碼生成任務上,端到端速度約快 6 倍;在 49k token 的長上下文檢索上約快 5.2 倍;在大規模 SQL 生成與最佳化任務上約快 5 倍;在演算法問題上快 4.6 倍;在非同步重構任務上快 3.9 倍。請將這些視為參考,而非精確數據:同任務的端到端數字包含了思考時間、首個 token 延遲和生成速度,而且來自個別測試者,而非受控的測試套件。所有測試結果一致的方向才是值得關注的信號,而不是任何單一倍數。
測試版核心的問題
最具戰略性的細節,藏在DeepSeek隨測試附上的回饋表單中。除了關於代理框架與真實世界情境的問題,表單還直接詢問測試者:DeepSeek V4.1 Flash 中間版本「能否完全取代線上的DeepSeek V4 Pro」。對一間公司來說,把這樣的問題放到使用者面前相當不尋常;因為DeepSeek V4 Pro 的定價比Flash高出三個價格級距。以目前官方費率,Pro 模型在離峰時段每1M輸入token(快取未命中)收費0.66美元、每1M輸出token收費1.98美元;相較之下,DeepSeek V4 Flash是0.22美元與0.66美元——每一項都是整整3×。如果一個Flash級別的模型真能以Flash級別的價格接近Pro級別的能力,對很大一部分使用者而言,答案已不言可喻;DeepSeek也深知這點。
若將問卷與「new structure」的措辭放在一起解讀,它暗示 V4.1 Flash 是某個比「小幅更新」更大計劃的第一個可見步驟——這是一條被重新定位的 Flash 產品線,目的是壓縮與旗艦之間的差距;正如 DeepSeek 屢次利用更便宜、更快的模型,來重設市場對於某一價格帶所能獲得之效能的預期。這些都不是透過基準測試能證實的;這是對一道兩句話問題的策略性解讀。但這是 DeepSeek 今天關於 V4.1 Flash 所說過最耐人尋味的話。
在哪裡試用,以及在此期間該在正式環境中執行什麼?
在測試期間,唯一能存取 V4.1 Flash 的地方是 DeepSeek 自家的 API——目前沒有任何第三方代管這個兩天後就會失效的版本,任何人也不該把正式環境的流量接到一個排定即將停止回應的模型 ID 上。接下來兩天最合理的用途是評估:執行你有代表性的工作負載,衡量品質與實際的 token 成本效益,並在官方發布正式版本並附上模型卡之前,把任何你看到的速度數字都視為僅供參考。
For traffic that has to keep working, the public DeepSeek lineup is unchanged, and that is where a routing layer earns its keep. On OrcaRouter, DeepSeek V4 Flash, DeepSeek V4 Pro and DeepSeek-V4-Flash-Vision-Exp are all reachable through one API at DeepSeek's list price passed through with zero markup — so the August price cut has been live on our side since the day it landed, not whenever a margin spreadsheet got around to it. When a formal V4.1 Flash eventually ships to providers, the same setup is the low-switch-cost way to adopt it: send a slice of traffic to the new model, keep DeepSeek V4 Flash or V4 Pro as an automatic failover, and let the router DSL decide which calls deserve the unproven model and which should stay on the workhorse. You do not have to bet a production path on a two-day beta to find out whether it is good.

開放性問題
• 正式版何時推出?偵測到此模型的訊號指出,發布貼文預期「很快」就會出現;beta 版僅有兩天壽命,顯示 DeepSeek 並不打算讓外界等太久。
• 最終版本是否與此版本相符?追蹤 DeepSeek 測試週期的獨立測試人員指出,該公司似乎同時並行運行多個候選版本,而早期測試中速度最快的候選版本不一定就是最終發布的那一個——因此今天的速度數據可能無法代表 GA 模型。
• 規格為何?參數量、架構細節、上下文長度,以及完整的輸入模態清單全都尚未公開,而這些正是一篇真正的評測首先需要的内容。
• 價格會維持不變嗎?「較低成本」在真實工作負載下還能成立嗎?測試版目前按 DeepSeek V4 Flash 的費率計費;正式推出時可能會有新的價目表,而每項任務的成本尚未被實際衡量。
• 它真的能勝任 Pro 級別的重任嗎?問卷中提出了這個問題,但只有針對智能體能力與推理套件的獨立評估——也就是當前區分 Flash 與 Pro 等級的基準——才能回答這個問題。
如果你有 DeepSeek 的金鑰,故事的關鍵是那兩天的時限:趁 deepseek-v4.1-flash-expires-on-0910 消失前呼叫它,跑你自己的負載,然後把數字歸檔到「社區實測,條件各異」之下。對其他人來說,要看的是發布文章,以及文章背後的問題——DeepSeek 最便宜的檔位是不是剛開始把矛頭對準它最貴的那個方案。
在為期兩天的 Beta 版仍忙著自我修正之際,你今天實際能跑的穩定 Flash 模型,其實只差一次 API 呼叫:DeepSeek V4 Flash on OrcaRouter — 以 DeepSeek 的定價傳送,0% 加價轉手。
而Beta問卷一直要求測試者拿V4.1 Flash與之相比的旗艦產品是:DeepSeek V4 Pro on OrcaRouter。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
