Gemini 3.5 Flash-Lite vs Qwen 3.8:平價實幹型 vs 2.4T 旗艦
Guides & Insights

Gemini 3.5 Flash-Lite vs Qwen 3.8:平價實幹型 vs 2.4T 旗艦

作者

Jim Song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

當這份比較首次撰寫時,它以一種不尋常的方式呈現失衡:Gemini 3.5 Flash-Lite是真實可購買的產品,而Qwen 3.8僅是受限制的預覽版,沒有價格、沒有基準測試,也沒有權重。幾乎沒有什麼可以比較的。

情況已不再如此。Qwen3.8-Max 已於 2026 年 8 月 3 日正式全面上市,並公布了每百萬個 token 2 美元 / 6 美元的定價表、相容 OpenAI 與 DashScope 的端點,以及完整的基準測試表。它可自助使用、可預算管控,且已正式上線——包括在 OrcaRouter 上。因此,這篇文章已從頭徹底改寫,因為如今誠實的比較不再是「已出貨模型對比空中樓閣」,而是一場真正的等級比較:Google 最便宜的高吞吐量主力機型,對上阿里巴巴最大的旗艦模型。

給開發者的一點說明——這兩個方案位於成本曲線的兩端,所以正確的問題是您的工作負載屬於哪一層級。OrcaRouter 在單一 OpenAI 相容端點背後整合了 200 多個模型,讓您無需設置兩套 SDK,即可在同一任務上測試兩者。

TL;DR 結論。 這些模型其實並非真正在彼此競爭——它們回答的是不同的問題。Flash-Lite 是一款效率型模型:Artificial Analysis Index 36$0.30 / $2.50 每 1M,約 490 tokens/sec,已全面開放。它的設計目標是以極低成本處理每一個請求。Qwen3.8-Max 是旗艦級模型:約 2.4T 參數、1M token 定額上下文、原生影像與影片輸入,以及自報的前沿級分數(GPQA Diamond 92.6、Terminal-Bench 2.1 86.6)——定價 $2 / $6,這是 Flash-Lite 輸入費率的 6.7 倍。Flash-Lite 是高流量分類、路由與擷取任務的正確預設選擇。當任務真正需要前沿推理、一百萬 token 的上下文或非文字輸入時,才升級到 Qwen3.8-Max。唯一不變的告誡是:Qwen 仍然沒有獨立評測分數。

關鍵要點

Qwen 3.8 現已全面推出 — 截至 2026 年 8 月 3 日,它已公布定價、自助使用權限和基準測試表。先前將其描述為受限且無法編列預算的預覽版,此說法已過時。

Flash-Lite 明顯更便宜: $0.30 / $2.50 每 1M 相較於 Qwen 的 $2 / $6 — 輸入約 6.7 倍,輸出約 2.4 倍。

Flash-Lite 快得多:大約490 tokens/sec,專為高吞吐量工作而設計。Qwen3.8-Max 在 OrcaRouter 的 7 天遙測中顯示 p50 到首個 token 的時間為 1.64 秒,但它是個大型且全面的模型。

Flash-Lite 擁有唯一經審計的分數:Artificial Analysis Index36。Qwen3.8-Max 仍然未獲評分,對於所有獨立評估機構來說都是如此,不過阿里巴巴現在發布了自己的數字。

Qwen 在能力面上取得壓倒性勝利:一個1M token 上下文統一計費,無長提示詞附加費用,加上文字/圖片/影片輸入,以及 OmniDocBench 1.5 92.1 的文件解析能力。Flash-Lite 是小型效率模型。

開放權重:Qwen 的開放權重預計本週內發布(尚無授權),另外還有 Qwen3.8-27B據稱可在約 17GB 的 VRAM 中運行。Flash-Lite 則永久封閉。

準確性說明:所有 Qwen3.8-Max 的品質數據均由阿里巴巴自行報告,未經第三方驗證。Gemini 3.5 Flash-Lite 的數據來自 Artificial Analysis。Qwen 定價依據阿里巴巴 Model Studio 的 GA(正式發布)費率表,取代本文先前版本所描述的預覽期存取方案。

規格與價格,並列呈現

• 開發者/狀態 — Flash-Lite:Google;已正式推出;Qwen3.8-Max:Alibaba;GA(2026年8月3日)

• 定位 — Flash-Lite:平價、高吞吐量的效率型等級;Qwen3.8-Max:旗艦/前沿野心

• AA Intelligence Index — Flash-Lite:36 (Artificial Analysis);Qwen3.8-Max:尚未評分

• 廠商回報的分數 — Flash-Lite:成績由第三方量測;Qwen3.8-Max:GPQA Diamond 92.6、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1、FrontierSWE 73.5(均為阿里巴巴回報)

• 價格(每1M,輸入/輸出)— Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00,在1M上下文內價格固定;緩存輸入$0.25

• 速度 — Flash-Lite:~490 tok/sec(Artificial Analysis);Qwen3.8-Max:p50 TTFT 1.64秒(OrcaRouter 7天遙測)

• 上下文 — Flash-Lite:效率級上下文;Qwen3.8-Max:1M tokens(思考模式下為 983,616;最大輸出為 131,072)

• 模態 — Flash-Lite:以文字為主的效率模型;Qwen3.8-Max:文字、圖片、影片輸入 → 文字輸出

• 權重 — Flash-Lite:封閉,僅限 API;Qwen3.8-Max:承諾本週內,尚無授權

• 今日即可使用 — Flash-Lite:標準 API、自助服務;Qwen3.8-Max:標準 API、自助服務(Model Studio、DashScope、OrcaRouter)

如此排列之後,結論與過去截然不同。Qwen 的那一欄不再空白——現在滿了,而且在多個欄列中它都是較強的一方。取代過往「已知量對比承諾」框架的,是明確的等級落差:Flash-Lite 的輸入成本約便宜 6.7 倍,吞吐量約快 13 倍;而 Qwen 則提供百萬 token 的多模態上下文,以及號稱前沿等級的推理能力。兩者都是正當的產品,只是服務的用途不同。

舊有告誡仍適用的一項,是基準測試那一欄。Flash-Lite 的 Index 36 是由 Artificial Analysis 在公開排行榜上測得。Qwen 的所有數字——GPQA Diamond 92.6、Terminal-Bench 86.6,以及其他——都是由阿里巴巴在自己的測試框架中產出。比起完全不公布,這確實是一大進步,但這並非第三方驗證,而且實驗室只會公布他們佔優勢的基準測試。

Index 36 對比一款未評分的旗艦機:老實說,這很值得深思。

將 Flash-Lite 的 Index 36 與 Qwen 的 GPQA Diamond 92.6 相提並論,並宣稱勝負已定,這確實令人心動。但那將是雙重的範疇謬誤。

首先,Artificial Analysis Intelligence Index 是跨多項任務的綜合指標;GPQA Diamond 則是單一的研究生科學測驗。兩者不在同一尺度上,不能相互減除。

其次,更重要的是,Flash-Lite 從來就不是為了獲得高分而設計的。Index 36 正是效率模型的樣子。Google 的工程目標是打造一個夠便宜、夠快速的模型,能部署在每個傳入請求之前——工單路由、分類、擷取、大量摘要——在這些場景中,使用前沿模型在經濟上荒謬至極。以推理天花板來對標 2.4T 旗艦模型,忽略了它的定位。

我們能斷言的內容更狹窄,但也更有用。Qwen3.8-Max 極有可能是能力大幅更強的模型——其自報的數字遠高於 Index-36 模型所能達到的水準,而 FrontierSWE 從前代的 40.7 躍升至 73.5,顯示出實質進展。但「極有可能」仍只是一種推斷,因為尚無獨立評測者對其進行評分。作為對照,前代 Qwen3.7-Max 得分為46(AA Index)——高於 Flash-Lite 的 36,但遠不及前沿水準——因此阿里巴巴所暗示的世代躍升既大且未經證實。

實際後果是:如果你的任務是 Flash-Lite 已經能正確完成的,Qwen 更高的上限對你來說就毫無價值,而且你要為它付出 6.7 倍的價格。只有當 Flash-Lite 確實失敗時,上限才重要。

實際成本:數字上的層級差距

以一個高流量的分類任務為例:2,000 個輸入 token、200 個輸出 token,每天執行 500,000 次——一個實際的支援分流或內容路由情境。

Flash-Lite: 每次呼叫,0.002M × $0.30 = $0.0006,加上0.0002M × $2.50 = $0.0005。 ≈ 每次呼叫 $0.0011 → 約 $550/天。

Qwen3.8-Max:每次調用,0.002M × $2 = $0.004,加上 0.0002M × $6 = $0.0012。≈ 每次調用 $0.0052 → 約 $2,600/天。

• 每月:Flash-Lite ≈ $16,500;Qwen ≈ $78,000 — 相同任務量下差額為 $61,500。

在那種規模下,層級選擇是系統中最大的單一開銷項目,而對於效率模型就能處理的工作,很難有理由採用旗艦款。這正是 Flash-Lite 存在的定位。

現在反轉過來。以一個長文件任務為例:60萬個token的上下文,5,000個token的輸出,每天200次。

Qwen3.8-Max: 0.6M × $2 = $1.20,加上 0.005M × $6 = $0.03。≈ 每次呼叫 $1.23,沒有長提示詞附加費用——而且大約$0.18,如果上下文以 $0.25/1M 的快取價格計算。

Flash-Lite完全無法針對此形態定價,因為單次調用600,000 token的上下文並非效率級模型所設計來承載的。

因此,答案會完全取決於工作負載的形態,這才是真正的重點。Flash-Lite 在高量、短上下文的任務中以極大差距勝出。Qwen 則在需要一百萬 token 或非文字輸入的任務中勝出,此時 Flash-Lite 並非較便宜的選項,而是根本不在選項之列。

情境:哪個層級適用?

大規模支援分診與路由。 顯然是 Flash-Lite。Index 36 足以進行分類,而且每次呼叫約 $0.0011,你可以在每張工單上執行它。只需將少數模糊不清的案例升級至較大的模型。

整份文件的合約或申報分析。 Qwen3.8-Max。1M 固定費率上下文意味著一份 400 頁的文件只需一次呼叫即可處理完成,無需額外費用,也無需分塊,而其自報的 OmniDocBench 1.5 92.1 正是針對這類工作。

截圖、圖表或影片管線。預設使用 Qwen3.8-Max——它接受圖像和影片輸入,並在操作真實 GUI 方面取得 OSWorld-Verified 86.1 的成績。Flash-Lite 不適合作為非文字輸入的候選方案。

代理式編碼。 Qwen3.8-Max 在宣稱的數據上(Terminal-Bench 2.1 86.6、FrontierSWE 73.5),但需注意這些數據均未經獨立驗證;其最弱的自我報告分數是指令跟從方面的 IFBench 82.8 分——對於解析每個步驟輸出的管線而言,這是個實際風險。

雙層架構。通常正確答案會是兩者並用:Flash-Lite 作為每個請求的廉價第一道處理,Qwen3.8-Max 則作為升級路徑,專門處理那少數需要百萬 token、圖片或真正推理的請求。這種模式能捕捉 Flash-Lite 大部分的成本優勢,同時保有前沿選項可用。

自行架設與開放性

Flash-Lite 已永久關閉,且僅提供 API 使用——沒有自架(self-host)的方案。

Qwen3.8-Max的權重承諾在本週內發布,但旗艦版並非現實的目標:大約 1.2TB(4位元)相對於每張H200約141GB,意味著需要八張或更多頂級加速卡,而阿里巴巴仍未公開活化參數的數量,因此這筆支出能買到的吞吐量無法建模。目前也還沒有授權條款,這表示商業可用性尚未正式確定。

同時發布的Qwen3.8-27B才是對本地部署計劃真正重要的版本。它還開放權重,據報導僅需約17GB 的 VRAM即可運行,是一個真正的自架選項——而且值得注意的是,比起 2.4T 旗艦模型,它更貼近 Flash-Lite 的效率定位。

常見問題

我今天可以使用 Qwen 3.8 嗎?

是的。Qwen3.8-Max 於 2026 年 8 月 3 日正式推出一般可用版本,公布的定價為每 1M tokens 2 美元 / 6 美元,並提供 OpenAI 與 DashScope 相容的端點。可透過 Alibaba Model Studio、DashScope 及 OrcaRouter 自助使用。本文較早的版本描述了受限預覽;該資訊已過時。

哪個比較便宜?

Gemini 3.5 Flash-Lite 以大幅差距勝出:每 1M 單價為 $0.30 / $2.50,而 Qwen3.8-Max 為 $2 / $6——輸入端約便宜 6.7 倍,輸出端約便宜 2.4 倍。在大規模短上下文的工作中,這個差異壓倒了其他所有考量。

哪個比較好?

它们是不同层级的。Flash-Lite 是唯一拥有经审计评分(AA Index 36)的,但其设计初衷是低成本吞吐,而非推理能力。Qwen3.8-Max 很可能远更强大——其自报的 GPQA Diamond 92.6 和 Terminal-Bench 2.1 86.6 已达到前沿水平——但它没有独立基准测试,因此那仍属推断,而非实测结果。

哪個更快?

Flash-Lite 明顯勝出。Artificial Analysis 測得其吞吐量約為每秒 490 個 token,這正是其效率型設計的用途。Qwen3.8-Max 在 OrcaRouter 的 7 天遙測資料中顯示 p50 首次輸出延遲為 1.64 秒,但它是個龐大且全面的模型,預覽階段的評測者發現它在長篇代理型任務上表現緩慢。

Qwen 3.8 現在有開放權重嗎?

還沒有。Alibaba 表示旗艦模型的權重會在本週內釋出,但目前仍沒有授權條款、模型卡或儲存庫。即使正式釋出,2.4T 的模型仍需要八顆以上的 H200 等級 GPU。同步發表的 Qwen3.8-27B,據稱約佔 17GB 的 VRAM,才是實際可行的自架選項。

我應該兩者都用嗎?

通常是的。雙層架構——讓 Flash-Lite 作為每個請求的低成本第一道處理,Qwen3.8-Max 則作為長上下文、多模態或真正困難任務的升級通道——既能保留 Flash-Lite 的大部分成本優勢,同時在它值得付出價格的地方,為你提供一個前沿的選擇。

我今天應該選擇哪一個用於生產環境?

Flash-Lite 適用於需要高吞吐量、短上下文、純文字工作,且 Index 36 即足夠的情況——它便宜、快速、經過審計且久經考驗。當工作負載需要百萬 token 的上下文、圖片或影片輸入,或需要 Flash-Lite 明顯無法勝任的推理時,則使用 Qwen3.8-Max。兩者現在都真正可以部署,而這在最初撰寫這份比較時並非如此。

底線

Gemini 3.5 Flash-Lite 與 Qwen 3.8 的比較過去曾是產品與公告之間的對比,如今已非如此。自 2026 年 8 月 3 日起,Qwen3.8-Max 已正式全面上市,並提供定價、自助服務與完整文件——因此更貼切的說法是這是產品等級的抉擇,而非產品是否就緒的問題。

Flash-Lite 仍然是針對其設計用途的正確預設選擇:以 $0.30 / $2.50 的價格和每秒約 490 個 token 的速度,它在每個請求上運行的成本幾乎微不足道,而其經審計的 Index 36 對於分類、路由和萃取來說完全足夠。Qwen3.8-Max 則是升級層級——百萬 token 的固定費率上下文、原生圖像與影片輸入,以及聲稱的前沿推理能力——輸入成本約為 6.7 倍。它唯一尚未解決的弱點與之前相同:沒有獨立評估者對其進行評分,因此其品質依據完全仰賴阿里巴巴自家的數據。請留意第一個獨立的 Intelligence Index 評分以及 Qwen3.8-27B 的權重,後者將更直接地與 Flash-Lite 的利基市場競爭。與此同時,請根據工作負載的形狀來選擇——並考慮同時運行兩者。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube