主視覺標題卡片寫著「2026 年免費的 LLM API」,副標題為「什麼才是真正免費——而你付出的代價是什麼」,在「三種貨幣」標題下展示三張卡片:「你的資料」(免費方案可能會用它來訓練)、「你的上限」(每日請求次數會用完)以及「你的等級」(頂尖模型僅限付費)。
Guides & Insights

2026 年免費 LLM API:哪些是真的免費,而你實際付出的代價是什麼

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

搜尋免費的 LLM API,你會得到一份清單。十三家供應商、十五家供應商、一張標誌表格、一欄綠色勾選標記。這些清單幾乎都不會告訴你的,正是決定免費方案是否實用的關鍵:每個免費的 LLM API 都會用某種東西向你收費。只是不是現金而已。

有三種貨幣。你用資料付費,用額度上限付費,或用模型等級付費——而且通常三種同時支付。本文根據各供應商自己的文件逐一說明,而非二手表格,然後回答那些清單跳過的問題:免費額度用完時會發生什麼?

貨幣一:您的資料

對於大多數團隊來說,這才是應該決定問題的關鍵,而它最多也只能得到一個註腳。

GoogleGemini API 定價頁面對此異常直接。對於每個有免費方案的模型,頁面都會列出你的內容會發生什麼事。在免費方案中,該行文字寫著: 「內容用於改善我們的產品。」 而在同一個模型的付費方案中,同一行文字則寫著:「內容不會用於改善我們的產品。」 同一個模型、同一個端點、同一份程式碼——唯一改變的是,Google 是否會保留你傳送的內容。

Mistral 的運作方式相同,但預設值不同。在 La Plateforme 上,除非你選擇退出,否則輸入和輸出資料會用於訓練模型,而免費方案使用者可以選擇退出——這是在管理控制台的隱私權選單中的一個切換選項,一旦確認,Mistral 就不再使用你的輸入和輸出進行訓練。團隊方案和企業方案則完全不在訓練資料池中。

這個區別比表面上看起來更重要。你找到的許多評測文章都會直接斷言 Mistral 的免費方案要求你接受訓練。這在較早的政策下確實如此,但現在已非如此。如果你根據六個月前的部落格文章來評估,你在兩個方向上都會出錯——要麼假設某個供應商是安全的(但實際上並非如此),要麼因為一個勾選框就能解決的事而將其排除在外。

務實的規則是:如果提示詞包含任何你會猶豫是否貼到公開論壇的內容,那麼免費方案就不是免費的。客戶記錄、內部程式碼、未發布的產品文案、任何受保密協議(NDA)約束的內容——在這些情況下,免費方案的成本是一個你悄悄為別人製造的資料治理問題。

Table titled 'What the free tier actually gives you' showing Groq's published free-plan limits — llama-3.1-8b-instant at 30 requests/min, 14,400 requests/day, 6,000 tokens/min, 500,000 tokens/day; llama-3.3-70b-versatile at 30 requests/min, 1,000 requests/day, 12,000 tokens/min, 100,000 tokens/day; whisper-large-v3 at 20 requests/min, 2,000 requests/day — alongside Google's free-tier Gemini model list and the pricing-page clause 'Content used to improve our products' on free versus 'not used' on paid.

貨幣二:你的上限

免費層級的計量維度比人們預期的更多,而你會先撞上哪個就用完哪個。Groq 公布了其免費方案按模型劃分的限制,而其形態頗具啟發性:

對照這兩個模型行。每分鐘請求數相同,但較大的模型給您每天 1,000 次請求,而非 14,400 次——能力升級的代價是配額縮減為十四分之一。此外,這些限制適用於組織層級,而非每位使用者,所以同一帳號下的第二位開發者不會有各自的配額;他們會耗用您的配額。

每日配額是悄悄扼殺專案的那種限制。一天 1,000 次請求聽起來很慷慨,但一旦把它用在實際用途上:一個聊天功能,50 個使用者每人 20 輪對話,就耗掉你整整一天的額度。一個夜間批次工作若在失敗時重試,可能在早餐前就把額度燒光。每分鐘的速率限制,你可以用佇列繞過去設計。但每日上限你無法繞過——只能等待午夜重置。

開始建置之前要盤算的數字,不是「有沒有免費方案」,而是「每個使用者每天的請求預算有多少,這能支撐多少使用者?」如果答案不到一百,那你就是在建置一個展示,你應該一開始就明白。

貨幣三:您的模型等級

第三個成本,是決定你實際上能建構什麼的關鍵:前沿模型不在免費方案中,而且差距正在擴大。

Google 的免費方案現在涵蓋 Flash 系列與嵌入模型——Gemini 3.6 FlashGemini 3.5 FlashGemini 3.5 Flash-LiteGemini 3.1 Flash-LiteGemini 2.5 FlashGemini 2.5 Flash-LiteGemini 2.0 Flash。Pro 系列則不在其中。這是有意的縮減:Pro 系列模型自 2026 年起在 API 存取上改為僅限付費,免費方案自此只涵蓋 Flash 及以下等級。

這不是在抱怨——2026 年的 Flash 級模型確實很強大,對於分類、抽取、路由、摘要以及大多數檢索增強相關工作來說,無論你是否付費,它們都是正確的選擇。但這確實意味著免費方案無法回答你在評估期間最想得到答案的問題,那就是「好的模型能解決我的困難案例嗎?」你將評估廉價模型並向上推斷,而這種推斷往往在兩個方向上都是錯誤的。

真正按token免費的那一個

有一個類別,這些綜述通常會提到,但很少深入思考:你自行運行的開放權重模型。 下載權重,在你自己的硬體上提供服務,每個 token 的邊際成本確實為零。沒有速率限制、沒有每日上限、沒有訓練條款、沒有等級——你完全擁有整個東西。

你所做的,是把成本從一項明細項目轉移到薪資單上。總得有人來配置 GPU 規模、挑選並調校 serving 堆疊、持續修補漏洞、在吞吐量崩潰時處理凌晨三點的警報,然後兩個月後更好的 checkpoint 釋出時,再把這一切重做一遍。對一個已經在營運基礎設施的團隊來說,在規模化之下,這往往是最便宜的做法。但對一個三個人要出貨產品的團隊而言,花一個工程師週在推論管線上,成本遠超過它所取代的數年 API 帳單。

當你有足夠的用量、存在無法以其他方式滿足的隱私需求,或已有現成的平台團隊時,自行託管是正確的答案。但當你真正需要的其實是不必再操心推論時,自行託管便是錯誤的答案。

Decision guide titled 'Which free option fits', mapping four situations to approaches: prototyping with non-sensitive data to taking the vendor free tiers; sensitive data to not using a free tier that trains on inputs; high volume to self-hosting open weights; shipping to production to asking cost per token and outage behaviour instead of what is free.

沒人算進表格裡的成本:免費方案無法組合

這就是實際上會耗費團隊時間的失敗模式,而它源自於過度忠實遵循免費方案建議。

你選擇了明智的路線。Google 的免費方案用於 Flash 等級的工作。另一家供應商的免費方案用於快速開放權重推論。第三家則負責語音。每一個都是貨真價實的免費,每一個都是明智的個人決策。六週後,你手上握著三組 API 金鑰、三套 SDK、三種速率限制機制、三種計費關係,以及三種不同的故障行為——而你的重試邏輯、可觀測性和成本核算,全都必須理解這一切。

然後其中一個改變了。提供者縮減了其免費方案——就像 Pro 級模型轉為僅付費時所發生的那樣。你的備援路徑從未被測試過,因為它從未觸發。你現在進行的遷移不是設定變更;而是對你為了掩蓋差異而建造的層進行重構,而且你是在時間壓力下進行,因為那東西已經在生產環境中。

免費方案確實是免費的。但你為了取得它而累積的供應商鎖定可不是。這才是你真正該在乎存取層是否可移植的原因:不是出於對供應商中立性的意識形態,而是因為免費方案是任何供應商產品中最不穩定的部分,直接押注在三個免費方案上,幾乎保證你一年內就得遷移某些東西。

實際該怎麼做

如果你只是在做原型開發,且資料不敏感——那就放心使用廠商的免費方案,不必感到愧疚。這些免費方案的存在正是為了這個目的。從第一天起就將整合寫在你自己的介面背後,這樣切換供應商就只是修改設定,而不是重構程式碼。

如果資料敏感——請勿使用會以你的輸入進行訓練的免費方案。要嘛付費購買供應商在合約上保證不會如此訓練的方案(Google 免費版與付費版的界線對此有明確說明),要嘛在供應商允許的免費方案中關閉訓練功能,要嘛自行架設。沒有第四種選項,而且等到上線後才發現這個問題,代價會遠比你想省下的 API 費用高昂得多。

如果你正在將不同模型互相比較評估 — 免費方案會誤導你,因為它並不包含你實際上線要用的模型。請在你打算用於正式環境的層級上,用你自己的提示詞進行評估。一次像樣的評測只需花費幾美元;而選錯的代價,是整整一季。

如果你要進入生產環境——問題就不再是「什麼是免費的」,而是「每個 token 的成本是多少,以及當這個供應商停機時會發生什麼事。」這些是不同的問題,有不同的答案,而免費方案兩者都無法回答。

OrcaRouter 的定位

OrcaRouter 運行一系列輪換的免費 AI 模型,呼叫價格為每 token $0,同時還有免費 API 額度來自公開優惠券發放、學生計劃和合作黑客鬆。建立帳戶並領取公開優惠無需付款方式;免費模型的陣容會隨著新的開放權重和促銷模型推出而變化,而來自優惠券或黑客鬆的促銷額度通常可以在整個目錄中使用,而不限於免費模型。

對上述問題而言,關鍵在於接下來發生的事情。一切都透過一個 OpenAI 相容的端點,因此你用於原型開發的免費模型與用於正式部署的前沿模型,採用的是同一種整合方式——只需更改模型欄位中的字串,而非遷移。當免費方案縮減或模型被棄用時,你更改模型 ID。當你需要比較 Gemini 3.6 FlashDeepSeek V4 Flash 時,用你自己的提示詞,無需註冊任何新服務即可完成。

那就是在談論免費 API 的文章中,對路由器最誠實的訴求:不是我們比免費更便宜,而是免費額度是你最不穩定、最難以賴以建構的東西,而這種不穩定性的代價,正是值得透過設計來消除的。

Screenshot of the OrcaRouter offers page at www.orcarouter.ai/offers in English, headlined 'Free AI API credits & free AI models' with the subtitle about claiming credits from live voucher drops, student programs and partner hackathons then calling a rotating set of free AI models at $0, plus live counters for hackathons, credit drops and top deposit match.

簡短版本

2026年的免費LLM API是真實存在、實用且值得使用的——適用於原型開發、非敏感工作負載、學習,以及Flash等級模型能完美勝任的大量任務。它們不是生產環境的策略,而且並非完全免費。

在您基於某個方案進行建置之前,請從供應商自己的文件中獲得三個書面答案,而不是從彙總文章中獲得:這個方案是否會用我的資料進行訓練?我每日的請求量上限是多少?以及我實際要部署的模型在這裡是否可用? 如果你能回答這三個問題,而且仍然喜歡這個方案,就接受它。如果你無法回答,那你根本沒有為它定價——你只是看到了數字零,然後就停止閱讀了。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新