
2026年免费LLM API:真正免费的是什么,以及你实际付出的代价
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
搜索免费的 LLM API,你会得到一份列表。十三家供应商,十五家供应商,一张 logo 表格,一列绿色对勾。这些列表几乎都没有告诉你的是,决定免费层级对你是否有用的关键部分:每个免费的 LLM API 都会以某种东西向你收费。只不过不是现金而已。
有三种货币。你可以用数据付费,可以用额度上限付费,也可以用模型等级付费——而且通常是三者同时付出。这篇文章会逐一剖析每一种,依据的是各家服务商自己的官方文档,而不是二手转述的对照表;然后回答那些表格都会跳过的问题:免费额度用完之后会发生什么。
货币一:你的数据
对大多数团队来说,这才是应该决定问题的那一个,但它充其量只会被当作脚注提及。
谷歌的 Gemini API 定价页面对此直言不讳。对于每个提供免费套餐的模型,该页面都列出了你的内容会发生什么。在免费套餐中,一行文字写道"内容用于改进我们的产品。" 而在同一模型的付费套餐中,同一行写道"内容不用于改进我们的产品。" 同一模型、同一端点、同一代码——唯一不同的是谷歌是否保留你发送的内容。
Mistral 的工作方式相同,只是默认设置不同。在 La Plateforme 上,除非你选择退出,否则输入和输出数据将用于训练模型,免费套餐用户可以退出——这是 Admin Console 隐私菜单中的一个开关,一旦确认,Mistral 将不再使用你的输入和输出进行训练。Team 和 Enterprise 套餐完全不在训练池中。
这一区别比表面看上去更重要。你会发现,很多评测汇总都直截了当地表示,Mistral 的免费套餐要求你接受训练。这在早期政策中属实,但现在已不再如此。如果你依据六个月前的博客文章来评估,就会在这两个方向上出错——要么以为某个提供商是安全的,而它其实并不安全;要么因为一个复选框就能解决的问题而将其排除在外。
实用规则:如果提示中包含任何你不愿粘贴到公共论坛的内容,那么免费层级就不免费。客户记录、内部代码、未发布的产品文案、任何受保密协议约束的内容——在这些情况下,免费层级的代价是你悄悄制造出来、留给别人去发现的数据治理问题。

货币二:你的上限
免费套餐的计量维度比人们预期的更多,而你遇到的是最先耗尽的那一项。Groq 按模型公布了其免费方案的限制,这种格局颇具启发性:
对比这两行模型参数。每分钟的请求数相同,但更大的模型给你 每天 1,000 次请求,而不是 14,400 次 — 作为能力升级的代价,请求量削减为原来的十四分之一。而且这些限制适用于组织层面,而非每个用户,因此同一账户下的第二个开发者没有自己的额度;他们会消耗你的额度。
每日上限才是悄悄扼杀项目的元凶。每天 1,000 次请求听起来很充裕,直到你把它接入任何真实场景:一个 50 个用户、每人 20 轮对话的聊天功能,就耗尽你一整天配额。一个失败重试的夜间批处理任务,可能在早饭前就把配额烧光。按分钟计费的速率限制,你可以用队列绕过去设计。但按天计费的上限不行——你只能干等午夜重置。
开始构建前需要弄清楚的问题不是"有没有免费套餐",而是"每个用户每天的请求预算是多少,这能支持多少用户?" 如果答案不到一百,那你就是在构建一个演示项目,这一点你应该在开始时就明白。
货币三:你的模型层级
第三个成本决定了你实际上能构建什么:前沿模型不在免费层级上,而且差距正在扩大。
Google 的免费套餐现在涵盖 Flash 系列和嵌入模型——Gemini 3.6 Flash、Gemini 3.5 Flash、Gemini 3.5 Flash-Lite、Gemini 3.1 Flash-Lite、Gemini 2.5 Flash、Gemini 2.5 Flash-Lite 和 Gemini 2.0 Flash。Pro 系列不在此列。这是刻意的收窄:Pro 系列模型自 2026 年起在 API 访问上仅限付费,免费套餐自此只涵盖 Flash 及以下型号。
这不是抱怨——2026年的Flash级模型确实很强,对于分类、抽取、路由、摘要以及大多数检索增强类任务,无论你是否付费,它们都是正确的选择。但这确实意味着,免费版无法回答你在评估时最想得到答案的问题,那就是"好的模型能解决我的困难案例吗?"你评估的是廉价模型,并据此向上推断,而这种推断经常在两个方向上都不准确。
真正按 token 免费的那个。
有一个类别,这些盘点通常会提到但很少深入思考:你自己运行的开放权重模型。下载权重,在你自己的硬件上提供服务,每个 token 的边际成本确实为零。没有速率限制,没有每日上限,没有训练条款,没有层级——你拥有全部。
你所做的,是把成本从一项预算条目移到了人力开支条目上。总得有人去配置GPU规模、挑选并调优推理服务栈、持续打补丁、在凌晨三点吞吐量骤降时被叫醒处理,并在两个月后更好的检查点发布时把这一切重来一遍。对于已经在运维基础设施的团队来说,这在规模化时可能远是最便宜的方案。但对于一个正在交付产品的三人团队而言,花一个工程师人周在推理管线搭建上,比它所替代的好几年API账单还要贵。
当您有规模需求、有不容许其他方案的隐私要求,或已有平台团队时,自托管是正确的答案。当您真正需要的只是不再为推理操心时,它就是错误的答案。

没人列进表格里的成本:免费层级无法组合
这就是真正会耗费团队时间的失败模式,它源于过度遵从免费层级的建议。
你选择了明智的路线。Flash 级别的工作用 Google 的免费套餐。快速开放权重推理用另一家提供商的免费套餐。语音再用第三家。每一个都是真正免费的,每一个单独来看都是合理的决定。六周后,你手里拿着三把 API 密钥、三套 SDK、三种速率限制机制、三种计费关系以及三种不同的故障行为——而你的重试逻辑、可观测性和成本核算必须理解所有这些。
然后其中一个发生了变化。某个提供商收紧了其免费层级——就像 Pro 级模型转为仅付费时发生的情况一样。你的回退路径从未被测试过,因为它从未被触发。你现在所做的迁移并不是配置变更,而是对为掩盖差异而构建的那一层进行的重构,而且你是在时间压力下进行这项工作的,因为该系统已经投入生产。
免费层级确实是免费的。但为了获得它而积累的锁定却不是。这才是真正需要关心访问层是否可移植的原因:不是关于供应商中立的意识形态,而是免费层级是任何提供商产品中最不稳定的部分,直接对接三个免费层级构建,保证你一年之内要迁移某些东西。
实际该做什么
如果你在做原型开发,且数据不敏感——那就心安理得地去用厂商的免费套餐吧。免费额度就是为此而存在的。从第一天起就把集成封装在自己定义的一个接口后面,这样更换供应商只是改个配置,而不是重构代码。
如果数据敏感——切勿使用会用你的输入进行训练的免费套餐。要么付费使用供应商在合同中承诺不这样做的套餐(谷歌对免费与付费的界限有明确说明),要么在提供方允许的情况下在免费套餐中关闭训练,要么自行托管。没有第四种选择,而且上线之后才发现这个问题,代价将远高于你原本想省下的 API 费用。
如果你要比较不同模型的优劣——免费档会误导你,因为它不包含你最终要上线的模型。请在你打算用于生产环境的档位上,用你自己的提示词来做评估。一次像样的评估只需几美元;而选错模型的代价是整个季度。
如果你要投入生产——问题就不再是“什么是免费的”,而是“每个 token 的成本是多少,以及这个提供商出现故障时会发生什么。”这些是不同的问题,答案也不同,免费层对这两个问题都无法回答。
OrcaRouter 的适用场景
OrcaRouter 运行一组轮换的免费 AI 模型,调用价格为 $0/每 token,同时还可获得免费 API 额度,这些额度来自公开的优惠券发放、学生项目和合作伙伴黑客松。创建账户并领取公开优惠无需支付方式;免费模型阵容会随着新的开放权重和促销模型的到来而变化,来自优惠券或黑客松的促销额度通常可在整个目录中使用,而非仅限于免费模型。
对于上述问题,关键在于接下来会发生什么。一切都通过一个 OpenAI 兼容端点,因此你用来做原型的免费模型和用于上线的前沿模型是同一套集成——只需更改模型字段中的字符串,而非迁移。当免费层收窄或某个模型被弃用时,你只需更改模型 ID。当你需要在你自己的提示词上比较Gemini 3.6 Flash与DeepSeek V4 Flash时,无需注册任何新服务即可完成。
这就是一篇关于免费API的文章中对路由器的诚恳推荐:不是说我们比免费更便宜,而是免费套餐是你所能依赖的最不稳定的基础,而这种不稳定所造成的代价,正是值得在设计中规避掉的。

简短版本
2026年的免费LLM API是真实存在、实用且值得使用的——适用于原型开发、非敏感工作负载、学习,以及Flash级模型能够完美处理的大量任务。它们不是生产策略,也并非真正免费。
在您基于某个服务进行构建之前,请从提供商的官方文档中获取三个问题的书面答案,而不是依赖汇总文章:该层级是否会使用我的数据进行训练?我每天的请求上限是多少?我实际要部署的模型在这里是否可用? 如果您能回答全部三个问题并且仍然喜欢这个方案,那就采纳它。如果您无法回答,说明您并没有真正评估过其价格——您只是看到了零这个数字就停止了阅读。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
