Thẻ tiêu đề chính có dòng chữ 'API LLM miễn phí trong năm 2026' với phụ đề 'Điều gì thực sự miễn phí — và bạn đánh đổi bằng gì', hiển thị ba thẻ dưới tiêu đề BA LOẠI TIỀN TỆ: DỮ LIỆU CỦA BẠN (các gói miễn phí có thể huấn luyện trên dữ liệu đó), TRẦN YÊU CẦU CỦA BẠN (số yêu cầu mỗi ngày bị cạn kiệt) và PHÂN HẠNG CỦA BẠN (các mô hình tiên tiến chỉ dành cho gói trả phí).
Guides & Insights

API LLM miễn phí năm 2026: Điều gì thực sự miễn phí, và bạn phải trả gì thay vào đó

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tìm kiếm một API LLM miễn phí và bạn sẽ có một danh sách. Mười ba nhà cung cấp, mười lăm nhà cung cấp, một bảng logo, một cột dấu tích màu xanh lá cây. Điều mà hầu như không danh sách nào trong số đó cho bạn biết chính là yếu tố quyết định liệu gói miễn phí có hữu ích với bạn hay không: mọi API LLM miễn phí đều khiến bạn phải trả bằng một thứ gì đó. Chỉ là không phải tiền mặt.

Có ba loại tiền tệ. Bạn trả bằng dữ liệu của mình, bạn trả bằng trần của mình, hoặc bạn trả bằng bậc mô hình của mình — và thường là cả ba cùng một lúc. Bài viết này lần lượt xem xét từng loại dựa trên chính tài liệu của các nhà cung cấp, không phải bảng tổng hợp gián tiếp, rồi trả lời câu hỏi mà những danh sách đó bỏ qua: điều gì xảy ra khi bậc miễn phí cạn kiệt.

Tiền tệ một: dữ liệu của bạn

Đây là điều nên quyết định vấn đề cho hầu hết các đội, vậy mà nó cũng chỉ được nhắc đến như một chú thích cuối trang mà thôi.

Trang giá API Gemini của Google thẳng thắn một cách bất thường về điều này. Đối với mọi mô hình có gói miễn phí, trang này liệt kê những gì xảy ra với nội dung của bạn. Trên gói miễn phí, dòng chữ ghi là "Nội dung được sử dụng để cải thiện sản phẩm của chúng tôi." Trên gói trả phí của cùng mô hình đó, dòng chữ tương tự ghi là "Nội dung không được sử dụng để cải thiện sản phẩm của chúng tôi." Cùng mô hình, cùng endpoint, cùng mã — điều duy nhất thay đổi là liệu Google có được giữ những gì bạn đã gửi hay không.

Mistral cũng hoạt động như vậy nhưng có cài đặt mặc định khác. Trên La Plateforme, dữ liệu đầu vào và đầu ra được sử dụng để huấn luyện mô hình trừ khi bạn chọn không tham gia, và người dùng gói miễn phí có thể chọn không tham gia — đây là một tùy chọn bật/tắt trong menu Quyền riêng tư của Bảng điều khiển quản trị, và sau khi xác nhận, Mistral sẽ ngừng sử dụng đầu vào và đầu ra của bạn để huấn luyện. Các gói Team và Enterprise hoàn toàn không nằm trong nhóm huấn luyện.

Sự khác biệt đó quan trọng hơn vẻ bề ngoài. Nhiều bài tổng hợp bạn sẽ tìm thấy nói thẳng rằng gói miễn phí của Mistral yêu cầu bạn chấp nhận việc huấn luyện. Điều đó từng đúng với chính sách trước đây nhưng hiện tại thì không còn đúng nữa. Nếu bạn đánh giá dựa trên một bài blog từ sáu tháng trước, bạn sẽ hiểu sai theo cả hai hướng — cho rằng một nhà cung cấp an toàn trong khi thực ra không phải, hoặc loại bỏ một nhà cung cấp trong khi chỉ cần một ô đánh dấu là giải quyết được.

Quy tắc thực tế: nếu prompt chứa bất cứ điều gì bạn sẽ do dự khi dán vào một diễn đàn công cộng, thì gói miễn phí không thực sự miễn phí. Hồ sơ khách hàng, mã nội bộ, nội dung sản phẩm chưa phát hành, bất cứ thứ gì thuộc NDA — chi phí của gói miễn phí ở đó là một vấn đề quản trị dữ liệu mà bạn đã âm thầm tạo ra để người khác tìm thấy.

Table titled 'What the free tier actually gives you' showing Groq's published free-plan limits — llama-3.1-8b-instant at 30 requests/min, 14,400 requests/day, 6,000 tokens/min, 500,000 tokens/day; llama-3.3-70b-versatile at 30 requests/min, 1,000 requests/day, 12,000 tokens/min, 100,000 tokens/day; whisper-large-v3 at 20 requests/min, 2,000 requests/day — alongside Google's free-tier Gemini model list and the pricing-page clause 'Content used to improve our products' on free versus 'not used' on paid.

Tiền tệ thứ hai: mức trần của bạn

Các gói miễn phí bị giới hạn trên nhiều chiều hơn mọi người vẫn tưởng, và bạn sẽ chạm tới chiều nào hết trước. Groq công bố giới hạn gói miễn phí theo từng mô hình, và cấu trúc này rất đáng tham khảo:

Hãy so sánh hai dòng mô hình đó với nhau. Cùng số yêu cầu mỗi phút, nhưng mô hình lớn hơn cho bạn 1.000 yêu cầu mỗi ngày thay vì 14.400 — giảm gấp mười bốn lần để đổi lấy khả năng cao hơn. Và giới hạn áp dụng ở cấp tổ chức, không phải theo từng người dùng, nên một nhà phát triển thứ hai trên cùng tài khoản sẽ không có hạn mức riêng; họ sẽ tiêu hao hạn mức của bạn.

Hạn mức theo ngày chính là thứ âm thầm giết chết các dự án. {{1}}1.000 yêu cầu mỗi ngày{{/1}} nghe có vẻ hào phóng cho đến khi bạn gắn nó vào bất cứ thứ gì thực tế: {{2}}một tính năng trò chuyện với 50 người dùng, mỗi người 20 lượt{{/2}} là cả ngày của bạn. {{3}}Một tác vụ hàng loạt chạy ban đêm có cơ chế thử lại khi thất bại{{/3}} có thể đốt cháy hạn mức trước bữa sáng. Giới hạn tốc độ theo phút bạn có thể xử lý bằng hàng đợi. Còn trần theo ngày thì không — {{4}}bạn chỉ có thể chờ đến nửa đêm{{/4}}.

Con số cần tính toán trước khi bạn xây dựng không phải là "có gói miễn phí không" mà là "ngân sách yêu cầu mỗi ngày cho mỗi người dùng của tôi là bao nhiêu, và điều đó hỗ trợ được bao nhiêu người dùng?" Nếu câu trả lời dưới một trăm, bạn đang xây dựng một bản demo, và bạn nên biết điều đó ngay từ đầu.

Loại tiền tệ thứ ba: cấp độ mô hình của bạn

Chi phí thứ ba là yếu tố định hình những gì bạn thực sự có thể xây dựng: các mô hình frontier không nằm trong các gói miễn phí, và khoảng cách đang ngày càng nới rộng.

Bậc miễn phí của Google hiện bao gồm lớp Flash và các mô hình embedding — Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemini 2.5 Flash, Gemini 2.5 Flash-LiteGemini 2.0 Flash. Dòng Pro không nằm trong đó. Đó là một sự thu hẹp có chủ đích: các mô hình dòng Pro đã được chuyển sang chỉ trả phí cho truy cập API vào năm 2026, và bậc miễn phí kể từ đó chỉ bao gồm Flash trở xuống.

Đây không phải là lời phàn nàn — các mô hình hạng Flash vào năm 2026 thực sự mạnh mẽ, và đối với phân loại, trích xuất, định tuyến, tóm tắt cùng hầu hết các tác vụ truy xuất tăng cường, chúng là lựa chọn đúng đắn dù bạn có trả phí hay không. Nhưng điều đó có nghĩa là gói miễn phí không thể trả lời câu hỏi bạn muốn được giải đáp nhất trong quá trình đánh giá, đó là "mô hình tốt có giải quyết được trường hợp khó của tôi không?" Bạn sẽ đánh giá mô hình rẻ hơn và suy luận ngược lên, và sự suy luận đó thường sai theo cả hai hướng.

Cái thực sự miễn phí theo từng token.

Có một nhóm mà các bài tổng hợp thường nhắc đến nhưng hiếm khi suy xét thấu đáo: các mô hình open-weight mà bạn tự vận hành. Tải bộ trọng số về, triển khai chúng trên phần cứng của riêng bạn, và chi phí cận biên cho mỗi token thực sự bằng không. Không giới hạn tốc độ, không hạn mức hàng ngày, không điều khoản huấn luyện, không phân hạng — bạn sở hữu toàn bộ.

Điều bạn đã làm là chuyển chi phí từ một hạng mục chi phí sang một dòng tiền lương. Ai đó phải xác định kích thước GPU, chọn và tinh chỉnh bộ serving stack, giữ cho nó được vá lỗi, xử lý cuộc gọi lúc 3 giờ sáng khi thông lượng sụp đổ, và làm lại tất cả khi một checkpoint tốt hơn xuất hiện hai tháng sau đó. Đối với một đội ngũ đã vận hành hạ tầng, đó có thể là lựa chọn rẻ nhất với biên độ lớn khi ở quy mô lớn. Đối với một nhóm ba người đang phát hành sản phẩm, một tuần công sức của kỹ sư dành cho việc xử lý suy luận tốn kém hơn vài năm hóa đơn API mà nó thay thế.

Tự lưu trữ là câu trả lời đúng khi bạn có khối lượng lớn, yêu cầu bảo mật không cho phép giải pháp nào khác, hoặc có sẵn đội ngũ nền tảng. Đó là câu trả lời sai khi điều bạn thực sự cần là ngừng phải bận tâm về việc suy luận.

Decision guide titled 'Which free option fits', mapping four situations to approaches: prototyping with non-sensitive data to taking the vendor free tiers; sensitive data to not using a free tier that trains on inputs; high volume to self-hosting open weights; shipping to production to asking cost per token and outage behaviour instead of what is free.

Chi phí không ai đưa vào bảng: các gói miễn phí không kết hợp được

Đây là kiểu thất bại thực sự ngốn thời gian của các đội nhóm, và nó xuất phát từ việc làm theo lời khuyên về bậc miễn phí một cách quá đà.

Bạn đi theo con đường hợp lý. Gói miễn phí của Google cho công việc lớp Flash. Gói miễn phí của một nhà cung cấp khác cho suy luận open-weight nhanh. Một gói thứ ba cho giọng nói. Mỗi gói đều thực sự miễn phí, mỗi quyết định riêng lẻ đều hợp lý. Sáu tuần sau, bạn đang cầm trên tay ba khóa API, ba SDK, ba chế độ giới hạn tốc độ, ba mối quan hệ thanh toán và ba hành vi lỗi khác nhau — và logic thử lại, khả năng quan sát và hạch toán chi phí của bạn phải hiểu tất cả chúng.

Rồi một trong số chúng thay đổi. Một nhà cung cấp thu hẹp gói miễn phí — như đã xảy ra khi các mô hình hạng Pro chuyển sang chỉ trả phí. Đường dự phòng của bạn chưa bao giờ được kiểm thử vì nó chưa bao giờ kích hoạt. Việc di chuyển bạn đang làm bây giờ không phải là một thay đổi cấu hình; đó là một cuộc tái cấu trúc lớp mà bạn đã xây dựng để che đậy sự khác biệt, và bạn đang làm điều đó dưới áp lực thời gian vì hệ thống đã đưa vào sản xuất.

Gói miễn phí thì miễn phí. Sự ràng buộc mà bạn tích lũy để có được nó thì không. Đây mới là lý do thực sự để quan tâm liệu lớp truy cập của bạn có di động được hay không: không phải là ý thức hệ về tính trung lập của nhà cung cấp, mà là thực tế rằng các gói miễn phí là phần dễ biến động nhất trong dịch vụ của bất kỳ nhà cung cấp nào, và việc xây dựng trực tiếp dựa trên ba trong số đó đảm bảo rằng bạn sẽ phải di chuyển một thứ gì đó trong vòng một năm.

Việc thực sự cần làm

Nếu bạn đang tạo nguyên mẫu và dữ liệu không nhạy cảm — hãy dùng các gói miễn phí của nhà cung cấp, và dùng chúng mà không hề áy náy. Chúng tồn tại chính là vì điều này. Hãy viết phần tích hợp đằng sau một giao diện của riêng bạn ngay từ ngày đầu để việc đổi nhà cung cấp chỉ là một thay đổi cấu hình, chứ không phải một lần refactor.

Nếu dữ liệu nhạy cảm — đừng dùng gói miễn phí huấn luyện trên dữ liệu đầu vào của bạn. Hoặc trả tiền cho gói mà nhà cung cấp cam kết theo hợp đồng không huấn luyện (ranh giới giữa bản miễn phí và trả phí của Google nói rõ điều này), tắt huấn luyện nếu nhà cung cấp cho phép trên gói miễn phí, hoặc tự lưu trữ. Không có lựa chọn thứ tư nào cả, và phát hiện ra điều này sau khi ra mắt sẽ tốn kém hơn nhiều so với hóa đơn API mà bạn đang cố tránh.

Nếu bạn đang đánh giá các mô hình với nhau — gói miễn phí sẽ đánh lừa bạn, vì nó không chứa các mô hình mà bạn định triển khai. Hãy đánh giá trên gói mà bạn định chạy trong production, với các prompt của chính bạn. Chi phí cho một lần đánh giá bài bản chỉ vài đô la; còn chi phí cho việc chọn sai là cả một quý.

Nếu bạn định đưa vào production — câu hỏi không còn là "cái gì miễn phí" nữa, mà trở thành "chi phí mỗi token là bao nhiêu, và điều gì xảy ra khi nhà cung cấp này gặp sự cố." Đó là những câu hỏi khác nhau với những câu trả lời khác nhau, và một gói miễn phí không trả lời được câu nào trong số đó.

OrcaRouter phù hợp ở đâu

OrcaRouter vận hành một bộ mô hình AI miễn phí luân phiên, có thể gọi với mức $0 mỗi token, cùng với các khoản tín dụng API miễn phí từ các đợt phát hành voucher công khai, chương trình sinh viên và hackathon đối tác. Việc tạo tài khoản và nhận một ưu đãi mở không yêu cầu phương thức thanh toán; danh sách các mô hình miễn phí thay đổi khi các mô hình open-weight và khuyến mại mới ra mắt, và tín dụng khuyến mại từ voucher hoặc hackathon thường có thể sử dụng trên toàn bộ danh mục thay vì chỉ giới hạn trong các mô hình miễn phí.

Phần quan trọng đối với vấn đề nêu trên là điều xảy ra tiếp theo. Mọi thứ đều chạy qua một endpoint tương thích với OpenAI, vì vậy mô hình miễn phí bạn dùng để tạo nguyên mẫu và mô hình tiên tiến bạn dùng để triển khai là cùng một tích hợp — chỉ cần thay đổi một chuỗi trong trường model, không phải là migration. Khi gói miễn phí bị thu hẹp hoặc một mô hình bị ngừng hỗ trợ, bạn chỉ cần đổi ID mô hình. Khi bạn cần so sánh Gemini 3.6 Flash với DeepSeek V4 Flash trên các prompt của riêng bạn, bạn làm được điều đó mà không cần đăng ký bất cứ điều gì mới.

Đó là lời chào hàng trung thực cho một bộ định tuyến trong một bài viết về API miễn phí: không phải rằng chúng tôi rẻ hơn miễn phí, mà là các gói miễn phí là thứ biến động nhất mà bạn có thể xây dựng dựa trên, và cái giá của sự biến động đó chính là thứ đáng để thiết kế nhằm loại bỏ.

Screenshot of the OrcaRouter offers page at www.orcarouter.ai/offers in English, headlined 'Free AI API credits & free AI models' with the subtitle about claiming credits from live voucher drops, student programs and partner hackathons then calling a rotating set of free AI models at $0, plus live counters for hackathons, credit drops and top deposit match.

Phiên bản ngắn

Các API LLM miễn phí trong năm 2026 là có thật, hữu ích và đáng để sử dụng — cho việc tạo nguyên mẫu, cho các khối lượng công việc không nhạy cảm, cho việc học tập, và cho một lớp lớn các tác vụ mà mô hình lớp Flash xử lý hoàn toàn tốt. Chúng không phải là một chiến lược sản xuất, và chúng không miễn phí.

Trước khi xây dựng trên một gói dịch vụ, hãy tìm ba câu trả lời bằng văn bản từ chính tài liệu của nhà cung cấp thay vì một bài tổng hợp: gói này có huấn luyện trên dữ liệu của tôi không, hạn mức yêu cầu mỗi ngày của tôi là bao nhiêu, và mô hình tôi thực sự định ra mắt có sẵn ở đây không?Nếu bạn trả lời được cả ba và vẫn thích thỏa thuận, hãy chốt. Nếu không trả lời được, bạn chưa định giá nó — bạn chỉ thấy con số không rồi ngừng đọc.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày