Gemini 3.5 Flash-Lite 对比 Qwen 3.8:廉价主力 vs 2.4T 旗舰
Guides & Insights

Gemini 3.5 Flash-Lite 对比 Qwen 3.8:廉价主力 vs 2.4T 旗舰

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

当这份对比最初撰写时,它以一种不寻常的方式失衡:Gemini 3.5 Flash-Lite是一个真实、可购买的产品,而Qwen 3.8只是一个受限预览,没有价格、没有基准测试、没有权重。几乎没有什么可比性。

情况已不再如此。Qwen3.8-Max 已于2026年8月3日全面上市,其公布的定价表为每百万token $2/$6,提供兼容OpenAI和DashScope的端点,并附有完整的基准测试表。它是自助式、预算可控的,并且已经上线——包括在OrcaRouter上。因此,本文已从头重写,因为如今诚实的比较已不再是"已发布模型对阵空头支票",而是真正的层级比较:谷歌最经济的高吞吐量主力模型对阵阿里巴巴最大的旗舰模型。

给构建者的一点说明——这两者位于成本曲线的两端,所以正确的问题是您的工作负载属于哪个层级。OrcaRouter 将 200 多个模型整合到一个兼容 OpenAI 的端点后面,因此您可以在同一任务上测试两者,而无需接入两个 SDK。

TL;DR 结论。这两款模型并非真正的竞争关系——它们回答的是不同的问题。Flash-Lite是一款效率型模型:Artificial Analysis Index 36$0.30 / $2.50每 1M,约 490 tokens/sec,已普遍可用。它旨在让每个请求都能以可忽略不计的成本运行。Qwen3.8-Max则是一款旗舰模型:约 2.4T 参数,配备100 万 token 的统一费率上下文窗口、原生图像与视频输入,以及自报的前沿水平分数(GPQA Diamond 92.6,Terminal-Bench 2.1 86.6)——定价为$2 / $6,即输入价格是 Flash-Lite 的 6.7 倍。Flash-Lite 是大规模分类、路由和抽取任务的正确默认选择。而当任务确实需要前沿推理、百万 token 上下文或非文本输入时,就该升级到 Qwen3.8-Max。有一点注意事项始终未变:Qwen 仍然没有独立的基准测试分数。

关键要点

Qwen 3.8 现已正式推出——截至2026年8月3日,它已发布定价、自助访问和基准测试表。此前关于受限、无预算预览的表述已不再适用。

Flash-Lite 便宜得多: $0.30 / $2.50每 1M,而 Qwen 的$2 / $6——输入约 6.7 倍,输出约 2.4 倍。

Flash-Lite 快得多:大约 490 tokens/秒,专为高吞吐量工作负载而设计。Qwen3.8-Max 在 OrcaRouter 的 7 天遥测数据中显示 p50 首token延迟为 1.64秒,但它是一个庞大而全面的模型。

Flash-Lite 是唯一拥有经审计评分的模型:Artificial Analysis Index36。Qwen3.8-Max 仍然未获评分——任何独立评测机构均未为其打分,尽管阿里巴巴现在公布了自己的数据。

Qwen 在能力面上以决定性优势胜出:一个按统一价格计费的100万token上下文,无长提示附加费,并支持文本/图像/视频输入,文档解析达到 OmniDocBench 1.5 92.1。Flash-Lite 是一个小型高效模型。

开放权重: Qwen 的模型承诺在本周内发布(尚无许可证),外加一个 Qwen3.8-27B 据称可在约 17GB 显存中运行。Flash-Lite 已永久关闭。

准确性说明:所有Qwen3.8-Max的质量数据均由阿里巴巴提供,未经第三方验证。Gemini 3.5 Flash-Lite的数据来自Artificial Analysis。Qwen的定价以阿里巴巴Model Studio的GA价格表为准,取代了本文早期版本中描述的预览期访问方式。

规格与价格,并列对比

• 制造商/状态 — Flash-Lite:谷歌;全面可用;Qwen3.8-Max:阿里巴巴;正式发布(2026年8月3日)

• 定位 — Flash-Lite:廉价、高吞吐的效率层级;Qwen3.8-Max:旗舰 / 前沿雄心

• AA Intelligence Index — Flash-Lite:36(Artificial Analysis);Qwen3.8-Max:尚未评分

• 厂商报告的分数 — Flash-Lite:排名由第三方测量;Qwen3.8-Max:GPQA Diamond 92.6、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1、FrontierSWE 73.5(均为阿里巴巴报告)

• 价格(每100万token,输入/输出)— Flash-Lite:$0.30 / $2.50;Qwen3.8-Max:$2.00 / $6.00,在100万上下文内价格固定;缓存输入$0.25

• 速度 — Flash-Lite: ~490 tok/sec(Artificial Analysis);Qwen3.8-Max: p50 TTFT 1.64s(OrcaRouter 7天遥测数据)

• 上下文 — Flash-Lite:效率级上下文;Qwen3.8-Max:1M tokens(开启思考时为 983,616;最大输出 131,072)

• 模态 — Flash-Lite:文本聚焦的高效模型;Qwen3.8-Max:文本、图像、视频输入 → 文本输出

• 权重 — Flash-Lite:不公开,仅限API;Qwen3.8-Max:承诺本周内,尚无许可证

• 今日即可访问 — Flash-Lite:标准 API,自助服务;Qwen3.8-Max:标准 API,自助服务(Model Studio、DashScope、OrcaRouter)

如此排列后,结论与以往截然不同。Qwen 那一列不再是空白——它已填满,而且在几行中它是更强的条目。取代旧的“已知量与承诺”对比框架的,是一个直接的层级差距:Flash-Lite 在输入上大约便宜 6.7 倍,吞吐量方面大约快 13 倍,而 Qwen 则提供百万 token 的多模态上下文和宣称达到前沿水平的推理能力。这两款都是合规产品;它们只是服务于不同的任务。

旧的告诫仍然适用的那一行是基准测试行。Flash-Lite 的 Index 36 由 Artificial Analysis 在公开排行榜上测得。Qwen 的所有数据——GPQA Diamond 92.6、Terminal-Bench 86.6 以及其他——都是阿里巴巴在自己的测试框架上得出的。这相比完全不发布确实是一大进步,但并非第三方验证,而且实验室只会发布自己胜出的基准。

Index 36 对飙未评分旗舰:实话实说

人们很容易把Flash-Lite的Index 36与Qwen的GPQA Diamond 92.6放在一起对比,然后宣布一场溃败。那将是一个双重范畴错误。

首先,Artificial Analysis Intelligence Index是许多任务的综合指标;GPQA Diamond是单一的研究生科学测试。它们不在同一尺度上,不能相互相减。

第二点,也是更重要的一点,Flash-Lite 从来就不是为了取得高分而设计的。Index 36 正是一个效率模型该有的样子。谷歌的工程目标,是打造一个足够便宜、足够快的模型,让它能部署到每一个传入请求的前端——工单路由、分类、信息抽取、大规模摘要——在这些场景下使用前沿模型在经济上是不可行的。拿推理能力上限去和 2.4T 旗舰模型比较,就误解了它的用途。

我们能说的范围更窄,但更有用。Qwen3.8-Max 极有可能是能力显著更强的模型——其自报数字远高于 Index-36 模型所能产出的水平,FrontierSWE 从前代产品的 40.7 跃升至 73.5,也表明取得了真正的进展。但“极有可能”仍是一种推断,因为尚无独立评测机构对其进行评分。作为参照,前代 Qwen3.7-Max 在 AA Index 上的得分为46,高于 Flash-Lite 的 36,但远未达到前沿水平,因此阿里巴巴所暗示的代际飞跃幅度巨大且未经证实。

实际结果是:如果你的任务属于 Flash-Lite 已能正确完成的那一类,那么 Qwen 更高的上限对你毫无价值,而你却要为其支付 6.7 倍的费用。只有当 Flash-Lite 确实无法胜任时,上限才真正重要。

实际成本:数字上的层级差距

以一个高负载的分类任务为例:输入 2,000 个 token,输出 200 个 token,每天运行 500,000 次——这是客服工单分流或内容路由的典型场景。

Flash-Lite:每次调用:0.002M × $0.30 = $0.0006,加上 0.0002M × $2.50 = $0.0005。每次调用 ≈ $0.0011 → 约 $550/天。

Qwen3.8-Max:每次调用:0.002M × $2 = $0.004,加上 0.0002M × $6 = $0.0012。≈ $0.0052/次调用 → 约 $2,600/天。

• 月度:Flash-Lite ≈ $16,500;Qwen ≈ $78,000 — 相同任务量的差额为 $61,500。

在这种规模下,层级选择是系统中最大的一项成本,而且很难为处理效率模型的工作选择旗舰版本。这正是Flash-Lite存在的场景。

现在反转一下。以一个长文档任务为例:600,000 个上下文 token,5,000 个输出 token,每天 200 次。

Qwen3.8-Max:0.6M × $2 = $1.20,另加 0.005M × $6 = $0.03。≈ 每次调用 $1.23,无长提示附加费——如果上下文按 $0.25/1M 缓存,则大约为$0.18

Flash-Lite根本无法为这种形态定价,因为 600,000 个 token 的单次调用上下文并不是效率层级模型设计来承载的。

因此,答案完全取决于工作负载的形态,这才是真正的教训。Flash-Lite 在大量短上下文任务中遥遥领先。Qwen 则在任何需要百万级 token 或非文本输入的任务中胜出,而 Flash-Lite 在这种情况下不是更便宜的选择,而是根本不可用。

场景:哪个层级合适

支持大规模工单分类与路由。显然用 Flash-Lite。索引 36 足以进行分类,每次调用约 0.0011 美元,你可以在每张工单上运行它。只需将少数不明确的工单升级至更大的模型。

整份文档的合同或案卷分析。 Qwen3.8-Max。100万token的固定费率上下文意味着400页的文档一次调用即可处理完毕,无附加费用,无需分块;其自报的OmniDocBench 1.5 92.1分正是针对此类工作。

截图、图表或视频流水线。默认使用 Qwen3.8-Max——它接受图像和视频输入,并在驱动真实 GUI 方面报告了 OSWorld-Verified 86.1 的成绩。Flash-Lite 不适合处理非文本输入。

智能体编码。就所声称的数据而言,Qwen3.8-Max(Terminal-Bench 2.1为86.6,FrontierSWE为73.5),但需注意,这些数据均未经独立验证,其自报得分最弱的是IFBench指令遵循能力82.8——这对于需要解析每一步输出的流水线来说是一个真实的风险。

双层架构。通常正确的答案是两者兼用:让 Flash-Lite 作为每个请求的廉价第一轮处理,Qwen3.8-Max 作为升级通道,用于处理少数需要百万 token、图像或真正推理的请求。这种模式能获得 Flash-Lite 大部分的成本优势,同时保持前沿选项可用。

自托管与开放性

Flash-Lite 已永久关闭,且仅限 API 使用——没有自托管途径。

Qwen3.8-Max 的权重承诺在本周内发布,但旗舰型号并非现实目标:大约1.2TB(4-bit 精度),而每块 H200 约为 141GB,这意味着需要八块或更多顶级加速器;阿里巴巴仍未披露活跃参数数量,因此这笔投入所能换取的吞吐量无法建模。此外,目前也还没有许可证文本,商业可用性在形式上尚未确定。

同时发布的Qwen3.8-27B才是对本地部署计划真正重要的版本。同样采用开放权重,据报道运行仅需约17GB显存,它是一个真正的自托管选择——而且值得注意的是,相较于2.4T旗舰模型,它与Flash-Lite效率定位的竞争要紧密得多。

常见问题

我今天可以使用 Qwen 3.8 吗?

是的。Qwen3.8-Max 于 2026 年 8 月 3 日正式全面可用,公布的定价为每 100 万个 token 2 美元 / 6 美元,并提供与 OpenAI 和 DashScope 兼容的端点。它可通过 Alibaba Model Studio、DashScope 和 OrcaRouter 自助使用。本文的早期版本描述的是受限预览;该信息已过时。

哪个更便宜?

Gemini 3.5 Flash-Lite 以压倒性优势胜出:每 1M token 输入/输出价格分别为 $0.30 / $2.50,而 Qwen3.8-Max 为 $2 / $6——输入便宜约 6.7 倍,输出便宜 2.4 倍。在大批量短上下文处理中,这一差异压倒了所有其他考量。

哪个更好?

它们是不同档次的模型。Flash-Lite 拥有唯一的经审计分数(AA Index 36),但它的设计目标是廉价吞吐量,而非推理能力。Qwen3.8-Max 的能力很可能远强于它——其自报的 GPQA Diamond 92.6 和 Terminal-Bench 2.1 86.6 均呈前沿形态——但它没有独立的基准测试,因此那仍是推断而非实测结果。

哪个更快?

Flash-Lite 则明显胜出。Artificial Analysis 测得其速度约为每秒 490 个 token,这正是其效率层级设计的用意所在。Qwen3.8-Max 在 OrcaRouter 的 7 天遥测中,p50 首 token 延迟为 1.64 秒,但它是一个庞大而全面的模型,预览期的评测者发现它在处理较长的智能体构建任务时速度较慢。

Qwen 3.8 现在有开放权重了吗?

还没有。阿里巴巴称旗舰权重将于本周内发布,但目前仍没有许可证、模型卡或代码仓库。即使发布后,2.4T 模型也需要八块或更多 H200 级 GPU。同期宣布的 Qwen3.8-27B 据称约需 17GB 显存,才是切实可行的自托管方案。

我应该两个都用吗?

{{1}}通常是这样。{{/1}} {{2}}两级架构{{/2}}——{{3}}Flash-Lite 作为每次请求的低成本首轮处理,{{/3}}{{4}}Qwen3.8-Max 作为长上下文、多模态或真正困难任务的升级通道{{/4}}——{{5}}既保留了 Flash-Lite 大部分的成本优势,又让你在任务真正值得时拥有一个前沿选项。{{/5}}

我今天应该为生产选择哪一个?

Flash-Lite 适用于高吞吐、短上下文、纯文本工作,在这些场景下 Index 36 已经足够——它廉价、快速、经过审计且久经考验。当工作负载需要百万级 token 的上下文、图像或视频输入,或需要 Flash-Lite 明显无法胜任的推理时,则使用 Qwen3.8-Max。两者现在都已真正可部署,而最初撰写此对比时并非如此。

底线

Gemini 3.5 Flash-Lite 对比 Qwen 3.8过去,这是产品与公告之间的比较,如今已不再如此。自2026年8月3日起,Qwen3.8-Max已全面开放,拥有明确定价、自助服务和完整文档——因此,如实而言,这是一个层级选择问题,而非就绪与否的问题。

对于其设计用途,Flash-Lite 仍然是正确的默认选择:{{1}}按 $0.30 / $2.50 定价、约 490 tokens/秒{{/1}},它{{2}}运行在每次请求上的成本可忽略不计{{/2}},而其{{3}}经审计的 Index 36{{/3}} 对于分类、路由和提取来说完全够用。Qwen3.8-Max 是升级档位——{{4}}百万 token 固定费用上下文、原生图像和视频输入,以及自称具备前沿推理能力{{/4}}——{{5}}输入成本约为其 6.7 倍{{/5}}。它尚未解决的一个弱点与之前相同:{{6}}没有独立评估机构为其评分{{/6}},因此其质量论证只能依赖{{7}}阿里巴巴自己的数据表{{/7}}。请留意{{8}}首个独立的 Intelligence Index 分数{{/8}}和{{9}}Qwen3.8-27B 权重{{/9}},后者将{{10}}与 Flash-Lite 的细分市场更直接地竞争{{/10}}。与此同时,请根据工作负载特征来选择——并考虑同时运行两者。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube