Qwen 3.7 Flash:阿里巴巴的極低成本視覺模型,專為真正觀看螢幕的代理打造
Guides & Insights

Qwen 3.7 Flash:阿里巴巴的極低成本視覺模型,專為真正觀看螢幕的代理打造

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

阿里巴巴的 Qwen 團隊在過去兩年發布了琳瑯滿目的模型陣容,涵蓋幾乎所有你能想到的價格與能力層級;2026 年 7 月 27 日,另一個模型以商業 API 列表的形式默默上線:qwen/qwen3.7-flash。它並未伴隨旗艦發布的盛大排場到來,阿里巴巴也沒有為它發布技術報告、基準測試套件或架構圖。它的到來所伴隨的,是一份對開發者而言遠比另一項排行榜分數更重要的描述:一個視覺語言推理模型、100 萬 token 的上下文視窗,以及低到幾乎無法成為一筆預算項目的定價。

這個組合——便宜、超長上下文,且原生「看見」圖像——讓 Qwen 3.7 Flash 直接落入了整個模型市場中最具競爭力且最實用的類別之一:低成本多模態主力模型。這些模型並非稱霸評比排行榜的類型,而是每天在代理迴圈、瀏覽器自動化流程及支援工具中被呼叫上千萬次的模型——因為每百萬個Token的輸入成本僅0.03美元、輸出成本0.13美元,成本基本上不再是設計上的限制條件。

這是一篇首發解說文章:Qwen 3.7 Flash 究竟是什麼、阿里巴巴公開了哪些資訊(以及,重要的是,尚未公開哪些)、實際的 token 計價如何影響成本效益,以及它在整個 Qwen 家族——包括規模大得多的 Qwen 3.8 和 Qwen 3.7 Max——與 Gemini 3.5 Flash-Lite 等平價多模態對手的比較中,處於什麼位置。我們還會探討像 OrcaRouter 這樣的路由層如何對待這類模型:不是作為旗艦模型,而是作為一個預設層級,默默地承接多模態流量的大宗。

太長;沒看

Qwen 3.7 Flash 是阿里巴巴 Qwen 團隊推出的視覺語言模型,其模型 ID 為qwen/qwen3.7-flash,自 2026 年 7 月 27 日起上線。該模型專為多模態代理、視覺編碼、搜尋及電腦/UI 互動而設計,號稱在物體辨識與空間理解方面表現出色。它支援100 萬 token 的上下文視窗,定價為每 100 萬輸入 token 0.03 美元、每 100 萬輸出 token 0.13 美元——堪稱市面上最便宜的視覺能力模型之一。最大輸出長度、確切參數數量及架構細節均未官方公開;社群猜測其可能採用小型混合專家(MoE)設計,並可能是開放權重 Qwen 3.7 版本的前身,但此說法未獲證實。它與 Qwen 3.8(阿里巴巴另行公布的 2.4T 參數開放權重旗艦模型)和 Qwen 3.7 Max(同世代中較大的旗艦模型)相比,是截然不同、更小且更便宜的模型。目前尚無任何獨立評測套件(包括 Artificial Analysis)對其進行評分,因此在第三方數據出現之前,請將品質宣稱視為早期且未經證實的資訊。

關鍵要點

• Qwen 3.7 Flash 是視覺語言模型,而非純文字模型——它定位於多模態代理、視覺編碼、搜尋及電腦操作任務,而非一般對話。

• 定價為每100萬個輸入代幣0.03美元,每100萬個輸出代幣0.13美元,大致與目前市場上最便宜的前沿多模態模型價格相當。

• 上下文窗口為 100 萬個令牌,這對於圖像密集型與多輪代理會話來說,比聽起來更為重要,因為圖像和螢幕截圖會快速消耗令牌。

該列表的定價說明指出,在重複上下文上啟用提示詞快取後,實際成本可比牌價低 60-80%——對於會重複載入相同系統提示詞或截圖歷史的代理循環而言,這是一個重要的成本槓桿。

• 阿里巴巴尚未公佈最大輸出Token數、參數規模或架構細節;任何在其他地方讀到的更具體資訊均為社群推測,而非供應商揭露。

• 它不是 Qwen 3.8(2.4T 的開放權重旗艦型號),也不是 Qwen 3.7 Max(同一發佈系列中較大的封閉旗艦型號)——除了命名相似外,這是三個不同的型號,各自承擔不同的任務。

• 截至目前,包括 Artificial Analysis 在內的獨立基準測試機構均未發布 Qwen 3.7 Flash 的評分——除了供應商描述之外,其品質確實未經證實。

Qwen 3.7 Flash 究竟是什麼

擺脫命名慣例後,Qwen 3.7 Flash 是阿里巴巴對一個所有主要實驗室都曾提出的問題的回答:當一個模型的整個設計目標是「以盡可能低的成本處理視覺、代理、高流量需求,同時不至於毫無用處」時,它會是什麼樣子?Google 用 Gemini Flash 和 Flash-Lite 層級回答了這個問題。OpenAI 用它的 mini 和 nano 系列回答了這個問題。而在這一代,阿里巴巴的回答是 Qwen 3.7 Flash。

官方描述聚焦於四個用例:多模態代理、視覺編碼、搜索,以及計算機或用戶界面交互。這是一份經過刻意挑選的清單。並非「擅長創意寫作」或「在數學奧林匹克問題上展現強大推理能力」——而是那些模型需要查看截圖、網頁、UI 元素或視覺呈現的程式碼差異,並據此採取行動的工作。阿里巴巴也特別指出物體識別與空間理解是其優勢,這與計算機使用和 UI 交互的框架一致:一個需要點擊按鈕、讀取佈局或導航螢幕的代理,不僅要知道文字內容,更要掌握物件的位置。

值得明確指出「推理」在此脈絡下的具體含義。Qwen 3.7 Flash 被描述為視覺語言推理模型,意味著它應能處理多步驟的視覺任務,而非僅限於為圖片添加標題或回答單一查詢問題。這正是「描述這張截圖」與「這是一張含有三個驗證錯誤的表單截圖——請找出問題所在,並告訴我應優先修正哪個欄位」之間的差異。

規格與多模態代理焦點

以下是實際已確認與尚未確認的完整清單。

已確認:開發者為阿里巴巴的 Qwen 團隊。它列於模型 ID qwen/qwen3.7-flash 之下,自 2026 年 7 月 27 日起上線。它接受多模態輸入(視覺與語言)。上下文視窗為 1,000,000 個 token。定價為每 1M 輸入 token 0.03 美元,每 1M 輸出 token 0.13 美元。該條目自身的定價說明指出,對重複上下文使用 prompt 快取,可讓有效成本較標價降低 60-80%,適用於在多次呼叫中重複使用相同系統指令或參考圖片的工作負載——這個細節對代理迴圈特別重要,因為此類迴圈每一輪都會重新傳送相同的螢幕截圖歷史或工具 schema。

未公开:最大输出Token限制。确切参数数量。架构(稠密型 vs. 混合专家型)。训练数据组成。任何第一方基准测试得分。

社群臆測(請如此標示,因為這不過是臆測):基於「Flash」的命名、激進的定價,以及阿里巴巴在先前Qwen世代遵循的模式,部分觀察者懷疑Qwen 3.7 Flash採用了一種小型混合專家架構,專為低每token計算成本而優化,並且它可能是最終開放權重Qwen 3.7發布前的預覽或蒸餾步驟,類似於早期Qwen「flash」或「turbo」變體有時先於更廣泛開放發布的情況。這些均未獲得阿里巴巴證實。在官方技術報告或模型卡片另有說明之前,請視為有根據的猜測,而非事實。

該模型沒有公佈最大輸出量這一事實,對於任何針對此模型進行開發的人來說都值得留意:如果你的使用場景需要生成較長的結構化輸出(大型JSON負載、多檔案程式碼生成、長篇逐字稿),請先透過實際測試驗證輸出上限,再將其投入生產環境,因為你無法在文件中查閱一個不存在的數字。

定價計算範例:實際成本是多少

這麼小的數字很容易被忽略,所以讓我們好好地做算術。

以每100萬個輸入Token 0.03美元和每100萬個輸出Token 0.13美元的價格計算,一次調用使用2,000個輸入Token(一張尺寸合理的截圖加上簡短指令)和300個輸出Token(結構化回答)的成本為:輸入部分 2,000/1,000,000 × 0.03美元 = 0.00006美元,輸出部分 300/1,000,000 × 0.13美元 = 0.000039美元。總計約每次$0.0001——百分之一美分。

將其擴展到大量。執行 100 萬次這類呼叫——對於一個中等規模的代理型產品來說,進行截圖分析或 UI 狀態檢查,這是合理的每日負載——結果是:1,000,000 × 2,000 = 20 億輸入 token × $0.03/100 萬 = $60,加上 1,000,000 × 300 = 3 億輸出 token × $0.13/100 萬 = $39。總計:100 萬次視覺代理呼叫約需 $99。即使在加入提示快取之前(清單中的說明指出,對於重複上下文的工作負載,這可以減少 60-80% 的費用),這個數字也是大多數團隊無需召開預算會議就能批准的。

現在比較一個更重的情境:一個電腦使用代理,它保持一個持續的50,000個token的上下文(截圖、操作歷史、工具結果),每一步產生500個token的操作,每天執行100,000次。輸入成本:100,000 × 50,000 = 50億個token × $0.03/百萬 = $150/天。輸出成本:100,000 × 500 = 5千萬個token × $0.13/百萬 = $6.50/天。這大約是$156/天,或約$4,700/月,對於一個相當密集的長上下文代理工作負載而言——而且這還未考慮對那50K上下文中重複部分的任何快取折扣,而在一個電腦使用迴圈(相同的系統提示、相同的工具定義、重疊的螢幕狀態)中,這正是提示快取所設計的工作負載類型。

真實世界情境演練

大量視覺任務

想像一個每天需對數十萬張產品圖片進行分類、標記與屬性擷取的產品編目流程——這類工作負載中,每個 token 的成本在中階視覺模型上會快速倍增,最終超出預算;但以 Qwen 3.7 Flash 的定價,卻能保持舒適的負擔能力。阿里巴巴明確提到的兩項能力——物體辨識與空間理解——直接對應到「圖像中有什麼、它在哪裡、以及它的狀況如何」。

視覺編碼

「視覺編碼」作為一個具體的使用情境,暗示了以下工作流程:將渲染後的使用者介面截圖與底層元件程式碼一起輸入模型,要求它找出不匹配之處;或者取得 Figma 匯出檔,然後獲得初步的實作版本。這是一個特別考驗純文字程式碼模型的任務類別——你可以用文字描述版面錯誤,但一個能真正看見破損的間距或未對齊的按鈕的模型,會更快且更可靠地診斷問題。

代理式 / 電腦使用

這是一個主要的使用案例。一個電腦使用代理需要查看螢幕、了解哪些是可點擊的、決定一個動作,然後重複——通常一個任務需要數十個步驟。對於昂貴的模型來說,這裡的經濟效益很嚴峻:一個30步驟的瀏覽器或桌面自動化任務,每一步都帶著一張新的截圖,在任務完成前可能累積數十萬個token。以尖端模型的定價,每個任務都要花費真金白銀;而以Qwen 3.7 Flash的定價,每天運行數千次這樣的會話,仍在小團隊的預算範圍內。

視覺搜尋——將圖像與資料庫比對、驗證檢索結果是否確實與參考照片相符,或將搜尋查詢錨定在使用者正檢視的螢幕截圖上——皆受益於相同組合:大上下文(以容納多個候選圖像或一長串檢索文件集)與低每次呼叫成本(因為搜尋與驗證循環通常意味著每個使用者查詢需多次模型呼叫,而非僅一次)。

如何存取和使用Qwen 3.7 Flash

Qwen 3.7 Flash 透過模型識別碼 qwen/qwen3.7-flash進行呼叫,並可與任何 OpenAI 相容工具搭配使用——這表示現有的 chat-completions 或 responses 風格整合,只需變更模型名稱就能指向它,而無需重寫用戶端程式碼。這也正是像 OrcaRouter 這樣的路由層從理論變成實務的場景:與其將單一模型寫死在每個服務中,不如透過一個統一的 OpenAI 相容端點,將便宜且能力不錯的多模態模型設為預設層級,用於視覺與代理型流量,而將較昂貴的推理模型保留給實際需要它們的請求子集。對於一個整體價值主張是「非常便宜、相當有能力、在前沿尚未獲得驗證」的模型而言,這種分層路由——預設便宜、需要時升級——可說是將其部署到生產環境的正確方式,而不是把整個管線押注在單一未經驗證的模型上。

標準多模態請求格式同樣適用:同一訊息中可同時包含圖片與文字輸入,支援多圖片或多輪對話的大型上下文視窗,且以逐 token 計費方式清楚呈現在用量儀表板中。在依賴輸出長度上限之前,請先針對自身工作負載進行測試,因為該最大值並未公布。

誠實的限制與未經確認的事項

直接來說,目前真正未知的是:截至本文撰寫時,來自 Artificial Analysis 或任何可比評估機構的 Qwen 3.7 Flash 獨立基準數據並不存在。關於其品質的一切——它在視覺推理上的實際表現如何、在代理性多步驟任務中的可靠性如何、在長上下文場景中對抗干擾的表現如何——目前僅由阿里巴巴自己的定位語言支持,而非第三方通過標準化測試套件進行評估。供應商描述與獨立驗證不是同一回事,讀者應在獨立驗證出現之前,據此權衡該模型的能力。

除了基準測試之外,阿里巴巴尚未公開其架構、參數數量或最大輸出長度。社群中流傳的「小型 MoE,可能是開放權重 Qwen 3.7 的前身」說法,是基於命名模式和定價的合理猜測,但這只是推測,並非阿里巴巴已確認的事實。如果模型透明度(已發布的架構、開放權重、技術報告)是您使用案例的要求,Qwen 3.7 Flash 目前並未達到這個標準——它是一個封閉、僅提供 API 的模型,除了 API 列表之外幾乎沒有公開文件。

比較:Qwen 3.8、Qwen 3.7 Max 與廉價競品

這裡的命名容易讓人混淆,因此值得精確說明。 Qwen 3.8是阿里巴巴另外公佈的開放權重旗艦模型,據報導基於2.4兆參數設計——這是一個本質上不同的模型,具有不同的目的:一個大型、開放、通用模型,旨在與前沿模型競爭,而不是廉價的多模態實用層級。 Qwen 3.7 Max是同一個「3.7」發布波次中更大、推測能力更強的封閉式旗艦模型——當任務需要最高品質且不計成本時,你會選用的模型。 Qwen 3.7 Flash,是本文的主題,是該系列中的第三個且最便宜的模型:更小、更快、價格大幅降低,且專門針對多模態代理工作負載,而非通用卓越性能。不要因為其中兩個共享版本號碼就假設這三者之間的能力或行為可以沿用——它們是不同用途的不同模型。

在外部競爭對手中,最接近的比較對象是 Google 的 Gemini 3.5 Flash-Lite,後者佔據了相似的利基市場:一種低成本、多模態、高吞吐量的層級,正適合上述這類大量工作負載。兩款模型主要在相同維度上競爭——每 token 價格、上下文長度與多模態處理能力——而非原始推理基準,因為兩者皆未被定位為前沿推理模型。在缺乏 Qwen 3.7 Flash 獨立基準數據的情況下,本文無法負責任地對其與 Gemini 3.5 Flash-Lite 之間的品質進行直接比較;可以確定的是,Qwen 3.7 Flash 的定價具有競爭力,甚至低於該層級,而其 100 萬 token 的上下文長度在此價格區間的模型中相當慷慨,這正是此類低成本多模態層級值得針對自身工作負載進行實測、而非僅依價格選擇的關鍵差距所在。

常見問題

什麼是 Qwen 3.7 Flash?

這是阿里巴巴 Qwen 團隊開發的視覺語言推理模型,專為多模態代理、視覺編碼、搜尋及電腦/使用者介面互動而設計,自2026年7月27日起以模型 ID qwen/qwen3.7-flash 列出。

Qwen 3.7 Flash 的費用是多少?

每100萬個輸入token收費0.03美元,每100萬個輸出token收費0.13美元——是目前市面上最便宜的視覺能力模型之一,列表中並指出,針對重複內容進行提示詞快取,還可享有60%至80%的額外折扣。

什麼是上下文視窗?

1,000,000 個令牌。

Qwen 3.7 Flash 和 Qwen 3.8 是同一个嗎?

不。Qwen 3.8 是阿里巴巴另行公布的2.4兆參數開放權重旗艦模型。Qwen 3.7 Flash 則是規模小得多、成本更低、封閉的多模態模型,用途不同。儘管兩者都來自阿里巴巴的 Qwen 系列,但不應混淆。

Qwen 3.7 Flash 和 Qwen 3.7 Max 是一樣的嗎?

不。Qwen 3.7 Max 是同一「3.7」發佈系列中較大的旗艦型號。Qwen 3.7 Flash 則是較小、較快、價格低得多的層級,主要針對高容量的多模態和智能體任務,而非追求最高品質的輸出。

Qwen 3.7 Flash 是否支援圖片?

是的,它是一個視覺語言模型——它接受多模態(圖像和文字)輸入,並專門針對視覺任務,如物體識別、空間理解、視覺編碼以及電腦/使用者介面互動。

最大输出长度是多少?

未由阿里巴巴正式公布。任何建構生產工作負載的人,應直接測試實際的輸出上限,而非假設一個數字。

Qwen 3.7 Flash 是混合專家模型嗎?

尚未確認。社群中有些人根據其定價和命名模式推測它使用了小型MoE架構,但阿里巴巴尚未公布架構細節,因此這仍只是推測而非事實。

它與 Gemini 3.5 Flash-Lite 相比如何?

兩者都定位在類似的低成本、高吞吐量多模態層級,主要競爭價格與上下文長度,而非原始推理基準。目前尚無獨立基準數據能對 Qwen 3.7 Flash 進行明確的品質比較。

我可以在哪裡使用 Qwen 3.7 Flash?

使用模型 ID qwen/qwen3.7-flash,可透過任何 OpenAI 相容的用戶端,或透過 OrcaRouter 這類路由層來設定,將其作為預設的低成本多模態層級,與其他模型並列使用。

Qwen 3.7 Flash 好嗎?

截至本文撰写时,尚未有独立验证——包括Artificial Analysis在内的第三方基准测试组织均未公布其评分。其价值主张在于价格和上下文长度,而非已被证明的质量领先优势,因此在投入实际使用前,值得根据您的特定工作负载进行实证测试。

底線

Qwen 3.7 Flash 的目標並非稱霸排行榜,阿里巴巴甚至未提供任何文件供人查核——即使它想這麼做。它真正要做的是,讓視覺與代理工作負載(如螢幕截圖分析、視覺化程式碼檢查、電腦操作循環、視覺搜尋)的成本降到足夠低,讓你不再因為價格因素而放棄開發相關功能。以每百萬 tokens 0.03/0.13 美元、搭配 100 萬 tokens 的上下文長度,這樣的經濟效益確實能支援大流量、全天候的多模態代理流量,這是市面上極少數模型——無論品質等級——能辦到的。問題在於必須誠實面對不足:缺乏獨立評測基準、未公開架構或最大輸出長度,而且在對抗 Gemini 3.5 Flash-Lite 等既有的低價對手時,實際表現仍充滿不確定性。可以把它視為一個前景看好、價格極度親民的預設選項,適合現在就測試多模態代理型工作——但在你的腦中,務必清楚將它與 Qwen 3.8 及 Qwen 3.7 Max 區隔開來,這兩者是截然不同的模型,分別解決完全不同的問題。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新