空荡荡的模型底座上的沙漏——Qwen3.8-27B的权重尚未发布,因此不存在免费的API。
Guides & Insights

免费 Qwen 3.8 27B API:尚未推出——取而代之可运行什么

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

不——截至2026年8月12日,既没有免费的Qwen3.8-27B API,也没有付费的。该模型于8月3日发布,承诺于“8月10日那一周”向Hugging Face和ModelScope开放权重,但官方Qwen组织仍然没有Qwen3.8仓库。在权重发布之前,没有人能托管Qwen3.8-27B,因此“免费”无从谈起。以下是在权重落地后获得免费的三种途径(以及每种途径的实际成本),外加你现在就可以在本地免费运行的模型。

还没有免费的API——权重才是门槛。

阿里巴巴于2026年8月3日发布了Qwen3.8系列:参数规模达2.4万亿的Qwen3.8-Max(约950亿激活参数,100万token上下文窗口,在阿里云百炼平台上输入每百万token定价2美元、输出每百万token定价6美元),以及密集架构、可单机部署的Qwen3.8-27B。两款模型均承诺于当周在Hugging Face和ModelScope上开放权重。

那个承诺现在已经逾期两天了。我8月12日直接查阅了Hugging Face:官方的Qwe​n组织没有任何形式的Qwen3.8仓库。模型搜索中出现的Qwen3.8-27B-GGUF、-FP8、-NVFP4A16和-NInfer仓库都是占位卡片——没有权重文件,下载次数为个位数,模型卡片上明确写着“在Qwe​n/Qwen3.8-27B发布之前保留”。不要把这些当作模型存在的证据;把它们当作是在预留停车位的人。

有两件事你不能想当然。第一,许可证:Qwen3.8-27B 尚未指定任何许可证。最近的 Qwen 开放权重以通义千问许可证发布,其月活跃用户超 1 亿的条款会在规模化时触发商业许可谈判——Apache 2.0 并非安全的默认选项。第二,规格:阿里巴巴尚未公布 27B 的基准测试表、上下文窗口或确认的硬件要求。如今关于它的一切复述都只是推测。

我们在《Qwen3.8-27B 开放权重:发布前已知信息》中介绍了发布前的检查清单——哪些内容已确认、哪些还只是传闻、下载前需要核实什么。而本文要讲述的,正是那篇文章没有覆盖的部分:当模型正式发布后,「免费」实际将如何运作。

当重担落下之后:通往自由的三种路径,以及各自真正的代价

“免费”从来不是真正免费的。获取免费 Qwen3.8-27B 的三条途径都会把成本转移到某处;区别在于成本落在哪里。27B 是密集模型——其约 270 亿个参数中每一个在每个 token 上都是激活的——因此下面的成本关乎真实硬件,而非营销话术。

Three routes to a free Qwen3.8-27B API after the weights drop: run it yourself, a hosted free tier, or OrcaRouter's planned free tier — and the real cost of each.

路线1:自行运行——现金免费,硬件定价

唯一一条在硬件买下后“免费”真正名副其实的路线。Unsloth 联合创始人 Daniel Han 预计 27B 模型在发布时大约需要 17GB 显存即可运行——这是一个目标值,而非已发布的规格。以 Qwen3.6-27B 的实测量化阶梯作为参考:Q4_K_M 大约 16GB,Q6_K 大约 21GB,FP8 大约 27GB,而完整 BF16 大约 54–56GB。目前现实的最低门槛是 24GB 显存的显卡——RTX 3090、RTX 4090 或 A6000 级别——配合 Q4 量化。

时机很重要:官方权重配合 vLLM 或 SGLang 通常能在发布后几天内正常工作,但社区 GGUF 和 AWQ 量化版本会滞后一到两周,因此在发布当天还不会有 Ollama 式的“拉取即运行”。隐藏成本是电力、一台安静的机器,以及你的时间。收益是隐私——没有任何数据离开你的设备——以及零边际成本,如果你还用 GPU 运行其他模型,这种优势还会不断累积。

路线 2:托管免费套餐——现金免费,代价是限制

权重发布后,预计阿里云会给出评测配额,常见的无服务器托管商也会提供免费额度。可预期的模式与阿里云对 Qwen3.8-Max 的做法一致:1M token 的新用户配额,仅限新加坡地域,有效期 90 天,不可结转——并且推理 token 按输出计费,因此默认会推理的模型可能一个周末的原型开发就把全部额度烧光。你实际付出的代价是速率限制、地域锁定、有效期,以及把你的提示词交给第三方。免费额度是让你上手评测模型的入口,而不是部署它的地方。

路线3:OrcaRouter 的免费套餐 — 计划中,尚未上线

因为搜索查询的字面意思就是“免费”,我们就把话说清楚:OrcaRouter 计划在 Qwen3.8-27B 的权重发布后推出免费档。它尚未上线。没有可调用的端点,我也不会贴一个占位示例。等有消息可宣布时,我们会宣布。我们今天实际托管的是 Qwen3.8-Max,每 100 万 token 2/6 美元,无加价——而 27B 不在平台上,因为目前还没有人能提供它。

你现在可以免费使用的

如果你的需求是“一个无需付费即可运行的27B级开源模型”,那么你无需等待。诚实的同级答案是Qwen3.6-27B,它是你正在等待的模型的直接前身。

Comparison of Qwen3.6-27B and Nemotron 3.5 Lightning 30B A3B, which you can run free today, against Qwen3.8-27B, which is not yet released.

Qwen3.6-27B采用 Apache 2.0 许可证,是一款稠密(dense)27.8B 参数模型,支持 262K 上下文长度,并原生支持文本、图像和视频输入。Q4_K_M 量化的 GGUF 文件约为 16.5GB,在 24GB 消费级 GPU 上运行速度约为每秒 25 个 token(在 M4 Max 上为每秒 16–18 个 token)。以下为其模型卡上厂商公布的数据:SWE-Bench Verified 77.2、MMLU-Pro 86.2、AIME 2026 94.1、GPQA Diamond 87.8、MMMU 82.9。如果说 Qwen3.8-27B 是“一款 27B 模型”,那么这款才是你今天真正能上手使用的 27B——同一系列、同样的稠密设计,而且已经开源。

Nemotron 3.5 Lightning 30B A3B是另一种形态,同样免费:于2026年8月11日发布,采用NVIDIA的OpenMDW 1.1许可证。它是一个总参数30B、激活参数约3B的混合专家(MoE)模型,采用混合Mamba-2架构,支持高达1M的上下文。NVFP4检查点大小约为21.6GB,Q4 GGUF约为25GB。它需要24GB以上显存的显卡,因为尽管每token只有约30亿参数被激活,但全部300亿参数都驻留在内存中。初步报告显示,在单张GPU上每秒可处理约45个token。它专为智能体执行层而构建——工具调用、验证、格式化——而非前沿推理。如果你的负载是海量智能体基础工作,它在你实际任务上可以胜过密集27B模型。

如果你现在需要的具体是一个免费的托管 API,而不是本地安装,那么唯一诚实的“免费”就是阿里巴巴的 Qwen3.8-Max 配额:100 万 token,新加坡区域,90 天。它不是 27B 版本,而且这是一种评测配额,而不是一项服务——现在可以用它来体验 Qwen3.8 的行为,之后再迁移。

当这条建议是错误的时候。

如果你已经拥有一块 24GB 以上的 GPU,"等待免费档位"这种说法对你不适用。权重发布当天,基于官方权重运行的 vLLM 就是你的免费档位;你只是在等待一种你根本不需要的便利。只有当你确实想要那套打磨完善的 GGUF 量化阶梯时,才值得再等大约两周。

如果你正在根据 API 契约进行原型开发,托管免费配额(一旦 27B 拥有配额)可能比你付出的时间成本更低——即使有 90 天有效期和区域锁定,租用 GPU 机器进行一周的原型开发通常反而更贵。

如果许可证最终是 Tongyi Qianwen 而不是 Apache,“free weights”并不意味着超过 1 亿 MAU 门槛后仍可自由商用。在基于它构建任何东西之前,请阅读实际仓库中的 LICENSE 文件——这正是“free open-weights”变成一张账单的最常见方式。

而如果阿里巴巴再次跳票——现在已经比承诺的期限晚了两天——那么每过一周,Qwen3.6-27B 就越发是正确的选择,而非权宜之计。

A timeline from announcement to free local run of Qwen3.8-27B.

底线

目前没有免费的Qwen3.8-27B API,因为任何地方都没有Qwen3.8-27B。等权重发布后,三条免费途径分别是:自托管(以硬件为代价)、托管免费层(以限制为代价),以及OrcaRouter计划中的免费层——该免费层尚未上线,上线后我们会明确告知。当下,最接近免费的选择是在自己的硬件上运行Qwen3.6-27B。等待并不会让你付出任何代价,除了27B本身;运行前代版本也不会让你付出任何代价,除了一个GPU——而你可以让这个GPU在等待期间顺便处理其他所有事情。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新