
Ling 3.0 Tiny 對決 Gemini 3.5 Flash-Lite:免費並不便宜,既有者仍是穩妥的選擇
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 586 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
- z-aiZ.ai: GLM 5.22026-06-1653智能69程式60數學
「免費」是模型市場詞彙中最昂貴的詞,因為它通常意味著有人準備向你收取標價以外的費用。這就是隱藏在以下兩者對決之中的陷阱:Ling 3.0 Tiny(螞蟻集團 InclusionAI 推出的全新 7.9B 參數 MoE 推理模型)與Gemini 3.5 Flash-Lite(Google 目前最便宜且最快的 Gemini 層級)。Ling 3.0 Tiny 目前可免費呼叫,8 月 14 日促銷後每百萬 token 為 $0.06 / $0.18——但 Artificial Analysis 測量到它燃燒了 2.1 億個輸出 token,僅為了在 56 個模型的類別中取得分數,而中位數為 6300 萬,因此將其標記為「非常冗長」。Gemini 3.5 Flash-Lite 的每 token 成本是其五倍,為 $0.30 / $2.50,但它擁有獨立的 Intelligence Index 36——比 Ling 3.0 Tiny 高出 13 分——以及每秒約 490 個 token 的輸出速度。標價較低、說話較快、分數較低的,其實是同一款模型。這就是這次比較的全部故事,也是你在僅僅因為價格就預設選擇新來者之前,需要三思的全部理由。
兩個模型都屬於平價級別,但它們處於該級別生命週期的不同階段。Gemini 3.5 Flash-Lite 是成熟的老牌產品:於 2026 年 7 月 21 日發布,由第三方持續重新評測,並被廣泛部署為高流量、低延遲代理式工作的預設等級。Ling 3.0 Tiny 才上市一週,定價旨在吸引用戶,且僅被評測過一次。本文將分別說明每個模型的實際定位、獨立數據所顯示的結果,以及為何「免費」定價是這項比較中最不具參考價值的數字。
Ling 3.0 Tiny,帶有節奏的新人
Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.
The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Gemini 3.5 Flash-Lite,現任者
Gemini 3.5 Flash-Lite 是 Google 對同一個問題的回答,在 Gemini 3.5 系列中低一個檔次。它在輸入端原生支援多模態——文字、圖片、影片、音訊與檔案——並提供文字輸出、1M token 的上下文視窗、最高 64K 的輸出 token,以及可設定的推理強度(minimal、low、higher),讓管線可以依每次請求調整深度與費用。其獨立評分堪稱真正的世代躍進:Artificial Analysis Intelligence Index 36,在 151 個受追蹤模型中排名第 12,較 Gemini 3.1 Flash-Lite 的 25 分有所提升。在速度方面,它是 3.5 系列中最快的模型——Google 在發表時宣稱每秒鐘可輸出 350 個 token,而 AA 的即時頁面實測約為每秒 490 個 token,在受追蹤模型中排名第 2。其廠商回報的 agentic 數據——OSWorld-Verified 74.0%、Terminal-Bench 2.1 54%、128K 多針檢索測試 72.2%——是 Google 自家數據,僅供方向參考而非金科玉律;此外,在依賴它之前,有一個懸而未決的問題值得確認(Google 部落格將 computer-use 列為內建功能,但 API 文件中並未支援)。
此外,就每 token 而言,其價格在同級產品中並不便宜。「Lite」這個名稱描述的是該模型在產品線中的定位,而非持續下滑的標價:Gemini 2.5 Flash-Lite 為每百萬 token $0.10 / $0.40,3.1 Flash-Lite 為 $0.25 / $1.50,而 3.5 Flash-Lite 為 $0.30 / $2.50,快取輸入則為 $0.03。效率上的優勢來自於速度與 token 經濟性,而 Artificial Analysis 自身的測量顯示,實際每項任務的成本大約逐代翻倍,即使每項任務所需時間已減半。
獨立計分板,於情境中閱讀
將兩個模型放在同一指標上,差距顯而易見:Gemini 3.5 Flash-Lite 為 36,Ling 3.0 Tiny 為 23。但這個頭條式比較只呈現了一半的圖像,因為這兩個模型並非在同一領域中評分。AA 將 Ling 3.0 Tiny 列為其小型模型類別中 56 個中的第 6 名,該類別中位數為 8——以同尺寸模型來說遠高於平均。Gemini 3.5 Flash-Lite 則在更廣泛的追蹤領域中,於 151 個模型中排名第 12。一個是傑出的小型模型;另一個是開放池中穩健的預算模型。兩種說法都成立,且它們代表的意義不同。Ling 3.0 Tiny 在其尺寸類別中的價值優於 Gemini 3.5 Flash-Lite 在其級別中的價值——而 Gemini 3.5 Flash-Lite 在同一獨立指標上仍然是能力明顯更強的模型。

尺寸,各佔一行:
• 獨立評分 — Ling 3.0 Tiny AA 指數 23 (#6/56, 類別中位數 8) vs Gemini 3.5 Flash-Lite AA 指數 36 (#12/151)。
• 價格 — Ling 3.0 Tiny 每 1M 為 $0.06 / $0.18(免費促銷後),對比 Gemini 3.5 Flash-Lite 每 1M 為 $0.30 / $2.50(快取輸入 $0.03)。
• 冗長度 — Ling 3.0 Tiny 在索引執行期間輸出 210M 個 token,而 Gemini 3.5 Flash-Lite 經測量,但依該旗標並不冗長。
• 模態 — Ling 3.0 Tiny 僅限文字,而 Gemini 3.5 Flash-Lite 支援文字、圖片、影片、音訊及檔案輸入。
• 上下文 — Ling 3.0 Tiny 為 256K,Gemini 3.5 Flash-Lite 為 1M,兩者最大輸出皆為 64K。
• 速度 — Ling 3.0 Tiny 在已發布數字的端點上約為 90–264 tokens/s,而 Gemini 3.5 Flash-Lite 在 AA 的實時測量中約為 490 tokens/s。
速度行是最可能變動的一列。Ling 3.0 Tiny 的輸出速度確實尚未有定論:Artificial Analysis 將其列為 N/A,而 Vercel 則宣稱每秒 264 個 tokens。Gemini 3.5 Flash-Lite 約每秒 490 個 tokens,這是它在自身發布波動平息後所進行的即時 AA 測量結果。對於延遲敏感的級別而言,這就是「已知量」與「未解之謎」之間的差別。
冗長經濟學:為什麼免費並不便宜
以下是通常決定這場對決的算術。在 Ling 3.0 Tiny 的促銷結束後,讓兩個模型都執行同樣的推理密集型任務——例如 4,000 個輸入 token、2,000 個輸出 token。Ling 3.0 Tiny 的計費為 (4,000 × $0.06 + 2,000 × $0.18) / 1,000,000,約 $0.0006。Gemini 3.5 Flash-Lite 的計費為 (4,000 × $0.30 + 2,000 × $2.50) / 1,000,000,約 $0.0062。在相同的 token 數量下,Ling 3.0 Tiny 便宜 10 倍。接著再加上冗長度的影響:一個會把思考 token 當作輸出產出的推理模型,並不會產生相同的 token 數量。如果 Ling 3.0 Tiny 的 210M 對 63M 冗長度比率在你的工作負載上成立,每個任務的實際成本在輸出端大約會變成三倍,10 倍的優勢也會縮小到 3–4 倍。仍然比較便宜——但不再是免費,而且也不像 210M 這個數字聽起來那樣有同等級的差距。
誠實地說,這兩個模型並非同等品質的替代品。Ling 3.0 Tiny 的 23 分,以一個 1.3B 活躍參數的模型而言是卓越的成績;Gemini 3.5 Flash-Lite 的 36 分則是另一個層級的能力,還加上視覺、1M 上下文和穩定的速度。你要為這個差距付出代價——每 token 價格的五倍,若把速度差異也算進去,每項任務的成本更高——但這是真正的能力差距,不是行銷話術。如果你的工作負載能適應較便宜模型的品質,Ling 3.0 Tiny 是更划算的選擇;如果你的工作負載需要這種能力,再大的價格優勢也無法填補這個差距。
路由器證明自身價值之處
這正是路由層勝過單一模型承諾的工作負載型態,而託管的事實條件決定了你如何建構它。Gemini 3.5 Flash-Lite 已於 OrcaRouter 上線,以供應商列表價提供——每 1M tokens 輸入 $0.30、輸出 $2.50,0% 加成直接轉嫁,所以 Google 費率表上的數字就是我們這邊的數字,未來任何降價也會在同一天同步生效。它與 200+ 個其他模型共用同一個 OpenAI 相容端點,當基礎供應商在執行中途效能衰退時,可跨供應商自動故障轉移;而路由 DSL 能將提示詞同時發送給多個模型,並保留最佳答案。
Ling 3.0 Tiny 並不在 OrcaRouter 上;它由自己的端點提供服務,目前免費。這種組合反而讓採用路由的理由更充分,而非更薄弱。趁著免費期間,在它開始收費之前,用你自己的流量對 Ling 3.0 Tiny 進行基準測試。然後在託管層上建構生產路徑——需要視覺、長上下文或穩定速度設定的呼叫,使用 Gemini 3.5 Flash-Lite;路由層則可自由升級到較昂貴的模型,以處理少數困難案例。免費層是絕佳的實驗,但也是脆弱的依賴;託管層才是你能賴以建構產品的基礎。在 OrcaRouter 上,你可以在同一個圖形中同時運行兩者——Ling 3.0 Tiny 透過直接端點,Gemini 3.5 Flash-Lite 透過金鑰——並讓路由器依每個請求來決定。

裁決
如果你要在這兩者之間做選擇,而不是將它們一起路由,這個決定說來簡單,卻難以讓人接受。Ling 3.0 Tiny 是更划算的交易,也是較弱的模型:它推出僅一週、僅支援文字的推理層級,以它的規模來說得分出色,價格極具競爭力,但速度和冗長程度的情況尚未明朗——值得立即進行免費試用評估,也值得知道它將在 8 月 14 日開始按量計費。Gemini 3.5 Flash-Lite 是更安全的生產環境預設選擇:獨立評分高出 13 分、多模態、100 萬上下文、根據確立的測量結果速度快五倍,價格也相應反映。當模型在較低的能力上限下,為了思考而說出三倍的話語時,免費並不便宜——而現任者之所以是安全牌,是有原因的。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
