
2026년 무료 LLM API: 실제로 무료인 것과 그 대가로 지불하는 것
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
무료 LLM API를 검색하면 목록이 나옵니다. 13개 제공업체, 15개 제공업체, 로고 표, 초록색 체크 표시 열. 그 목록 중 거의 어느 것도 알려주지 않는 것은 무료 등급이 유용한지 여부를 결정하는 부분입니다: 모든 무료 LLM API는 무언가로 비용을 청구합니다. 그저 현금이 아닐 뿐입니다.
세 가지 통화가 있습니다. 데이터로 지불하거나, 상한선으로 지불하거나, 모델 등급으로 지불합니다 — 그리고 보통 세 가지를 한꺼번에 지불합니다. 이 글은 각각을 공급업체의 자체 문서를 통해 살펴보며, 남의 표를 재탕하지 않고, 그런 목록들이 건너뛰는 질문에 답합니다: 무료 등급이 소진되면 어떻게 되는가.
통화 1: 당신의 데이터
이것은 대부분의 팀에게 결정적인 기준이 되어야 하는 것이며, 기껏해야 각주 하나만 얻는 것이기도 하다.
Google의 Gemini API 가격 페이지는 이 점에 대해 유난히 직접적입니다. 무료 등급이 있는 모든 모델에 대해, 페이지는 콘텐츠에 어떤 일이 일어나는지 나열합니다. 무료 등급에서 해당 문구는 이렇게 표시됩니다: "콘텐츠가 제품 개선에 사용됩니다." 같은 모델의 유료 등급에서는 같은 문구가 이렇게 표시됩니다: "콘텐츠는 제품 개선에 사용되지 않습니다." 같은 모델, 같은 엔드포인트, 같은 코드 — 바뀌는 것은 오직 Google이 당신이 보낸 내용을 보관할지 여부뿐입니다.
Mistral도 같은 방식으로 작동하지만 기본 설정은 다릅니다. La Plateforme에서는 옵트아웃하지 않는 한 입력 및 출력 데이터가 모델 학습에 사용되며, 무료 플랜 사용자는 옵트아웃할 수 있습니다. Admin Console의 Privacy 메뉴에 있는 토글입니다. 확인하면 Mistral은 더 이상 사용자의 입력과 출력을 학습에 사용하지 않습니다. Team 및 Enterprise 플랜은 애초에 학습 풀에 포함되지 않습니다.
그 구분은 보기보다 중요합니다. 흔히 찾아볼 수 있는 많은 요약 글들은 단정적으로 말합니다: Mistral의 무료 티어가요구한다, 훈련 동의를. 그것은 이전 정책에서는 사실이었지만 지금은 사실이 아닙니다. 6개월 전의 블로그 게시물을 기준으로 평가한다면 양방향으로 틀릴 수 있습니다 — 안전하지 않은 제공업체를 안전하다고 가정하거나, 체크박스 하나로 해결됐을 문제로 제공업체를 배제하는 경우입니다.
실용적인 규칙: 프롬프트에 공개 포럼에 붙여넣기를 주저할 만한 내용이 포함되어 있다면, 무료 티어는 무료가 아닙니다. 고객 기록, 내부 코드, 미공개 제품 카피, NDA가 적용되는 모든 것 — 그런 경우 무료 티어의 대가는 다른 사람이 발견하도록 당신이 조용히 만들어 놓은 데이터 관리 문제입니다.

통화 2: 당신의 한계
무료 티어는 사람들이 예상하는 것보다 더 많은 축에서 측정되며, 먼저 소진되는 축에 부딪히게 됩니다. Groq는 모델별로 무료 플랜 한도를 공개하는데, 그 형태는 시사하는 바가 큽니다:
두 모델 행을 서로 비교해 보세요. 분당 요청 수는 같지만, 더 큰 모델은 다음을 제공합니다: 하루 1,000회 요청(14,400회 대신) — 성능을 높이는 대신 14분의 1로 줄어든 수치입니다. 그리고 한도는 사용자별이 아니라 조직 수준에 적용되므로, 같은 계정의 두 번째 개발자는 자신만의 할당량을 받지 못하고 여러분의 할당량을 사용하게 됩니다.
일일 상한은 조용히 프로젝트를 죽이는 원인입니다. 하루 1,000건의 요청은 실제 무언가에 적용하기 전까지는 넉넉해 보입니다. 사용자 50명이 각각 20턴씩 대화하는 채팅 기능은 하루 용량 전체를 소모합니다. 실패 시 재시도하는 야간 배치 작업은 아침 식사 전에 상한을 소진할 수 있습니다. 분당 요청 수 제한은 큐로 해결할 수 있습니다. 하지만 하루 상한은 그럴 수 없습니다. 자정을 기다리는 수밖에 없습니다.
빌드하기 전에 알아야 할 숫자는 "무료 티어가 있나"가 아니라 "사용자당 하루 요청 예산은 얼마이고, 그 예산이 몇 명의 사용자를 지원하는가?"입니다 만약 그 답이 100 미만이라면, 당신은 데모를 만들고 있는 것이며, 처음부터 그 사실을 알아야 한다.
통화 3: 당신의 모델 등급
세 번째 비용은 실제로 무엇을 구축할 수 있는지를 결정짓는 요소입니다: 프론티어 모델은 무료 등급에 포함되지 않으며, 그 격차는 점점 더 벌어지고 있습니다.
Google의 무료 티어는 이제 Flash 클래스와 임베딩 모델을 포함합니다 — Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemini 2.5 Flash, Gemini 2.5 Flash-Lite 및 Gemini 2.0 Flash. Pro 라인은 여기에 포함되지 않습니다. 이는 의도적인 축소입니다: Pro 시리즈 모델은 2026년에 API 액세스가 유료 전용으로 전환되었으며, 그 이후로 무료 티어는 Flash 이하만 지원하고 있습니다.
이것은 불만이 아닙니다. 2026년의 Flash급 모델은 확실히 강력하며, 분류, 추출, 라우팅, 요약 및 대부분의 검색 증강 작업에 있어서는 비용을 지불하든 그렇지 않든 올바른 선택입니다. 하지만 이는 무료 티어가 평가 중에 가장 답을 얻고 싶어 하는 질문, 즉 "좋은 모델이 내 어려운 사례를 해결하는가?" 여러분은 저렴한 모델을 평가하면서 위로 추론하게 되며, 그 추론은 양방향으로 자주 틀립니다.
토큰당 정말 무료인 것
라운드업이 보통 언급하지만 좀처럼 생각해 보지 않는 카테고리가 있습니다: 직접 실행하는 오픈웨이트 모델. 가중치를 다운로드하여 자체 하드웨어에서 서빙하면 토큰당 한계 비용은 정말로 0입니다. 속도 제한도 없고, 일일 한도도 없고, 학습 조항도 없고, 등급도 없습니다. — 모든 것이 당신 소유입니다.
당신이 한 것은 비용을 지출 항목에서 인건비 항목으로 옮긴 것입니다. 누군가는 GPU 용량을 산정하고, 서빙 스택을 선택하고 튜닝하며, 패치를 유지하고, 처리량이 무너질 때 새벽 3시의 호출을 처리하고, 두 달 후 더 나은 체크포인트가 나오면 그 모든 것을 다시 해야 합니다. 이미 인프라를 운영하는 팀에게는 대규모 볼륨에서 그 방법이 압도적으로 가장 저렴한 선택일 수 있습니다. 제품을 출시하는 3인 팀에게는, 추론 파이프라인 작업에 쓰는 엔지니어 1주일의 비용이 그것이 대체한 API 요금의 수년 치보다 더 큽니다.
Self-hosting은 처리 볼륨이 있거나, 다른 해결책을 허용하지 않는 개인정보 보호 요구사항이 있거나, 기존 플랫폼 팀이 있을 때 올바른 답입니다. 하지만 실제로 원했던 것이 추론에 대해 더 이상 생각하지 않아도 되는 것이라면 잘못된 답입니다.

아무도 표에 넣지 않는 비용: 무료 티어는 서로 조합되지 않는다
실제로 팀의 시간을 소모시키는 실패 모드는 프리 티어 조언을 너무 잘 따른 데서 비롯됩니다.
당신은 합리적인 길을 택한다. Flash급 작업에는 Google의 무료 티어. 빠른 오픈 가중치 추론에는 다른 제공업체의 무료 티어. 음성에는 세 번째 제공업체. 각각은 진정으로 무료이며, 각각은 훌륭한 개별 결정이었다. 6주 후, 당신은 세 개의 API 키, 세 개의 SDK, 세 가지 속도 제한 체계, 세 개의 결제 관계, 그리고 세 가지 서로 다른 장애 동작을 쥐고 있다 — 그리고 당신의 재시도 로직, 관측 가능성, 비용 회계는 이 모든 것을 이해해야 한다.
그러던 중 하나가 바뀐다. 어떤 제공업체가 무료 티어를 축소한다 — Pro급 모델이 유료 전용으로 전환됐을 때처럼. 당신의 폴백 경로는 한 번도 발동된 적이 없어서 테스트된 적이 없다. 지금 수행 중인 마이그레이션은 설정 변경이 아니라, 차이점을 덮기 위해 만든 계층을 리팩터링하는 일이며, 그걸 이미 프로덕션에 올라간 상황에서 시간에 쫓겨 하고 있는 것이다.
무료 등급은 무료였다. 하지만 그 혜택을 얻기 위해 쌓아둔 락인은 무료가 아니었다. 이것이 액세스 레이어의 이식성에 신경 써야 하는 진짜 이유다: 벤더 중립성이라는 이데올로기 때문이 아니라, 무료 등급이 어떤 제공업체의 서비스 중에서도 가장 변동성이 큰 부분이며, 세 곳의 무료 등급을 대상으로 직접 구축하면 1년 안에 반드시 무언가를 마이그레이션하게 된다는 사실 때문이다.
실제로 해야 할 일
프로토타입을 만들고 있고 데이터가 민감하지 않다면 — 벤더의 무료 티어를 사용하고, 죄책감 없이 사용하세요. 그것들은 정확히 이런 경우를 위해 존재합니다. 공급자 교체가 리팩터링이 아니라 설정 변경이 되도록, 처음부터 자체 인터페이스 뒤에 통합을 작성하세요.
데이터가 민감한 경우 — 입력 데이터로 학습하는 무료 티어를 사용하지 마세요. 벤더가 계약상 학습하지 않는 유료 티어를 결제하거나(Google의 무료 대 유료 기준은 이 점을 명확히 명시합니다), 제공자가 무료 플랜에서 학습을 끌 수 있도록 허용하는 경우 학습을 끄거나, 자체 호스팅하세요. 네 번째 옵션은 없습니다. 출시 후에 이를 발견하는 것은 피하려던 API 비용보다 훨씬 더 비쌉니다.
모델들을 서로 비교 평가한다면 — 무료 티어는 여러분을 오도할 것입니다. 실제로 배포할 모델이 포함되어 있지 않기 때문입니다. 프로덕션에서 실행할 티어에서, 여러분 자신의 프롬프트로 평가하세요. 제대로 된 평가 비용은 몇 달러에 불과합니다. 하지만 잘못 고르는 비용은 한 분기 전체입니다.
프로덕션에 배포하려 한다면 — 질문은 "무엇이 무료인가"에서 "토큰당 비용이 얼마인가, 그리고 이 제공업체에 장애가 발생하면 어떻게 되는가"로 바뀐다. 이는 서로 다른 질문이고 답도 다르며, 무료 티어는 그 어느 쪽에도 답을 주지 못한다.
OrcaRouter가 적합한 위치
OrcaRouter는 무료 AI 모델의 순환 세트를 운영하며, 호출 비용은 토큰당 $0이며, 무료 API 크레딧도 공개 바우처 드롭, 학생 프로그램 및 파트너 해커톤을 통해 제공됩니다. 계정을 만들고 공개 오퍼를 이용하는 데에는 결제 수단이 필요하지 않습니다. 무료 모델 라인업은 새로운 오픈 가중치(open-weight) 모델과 프로모션 모델이 등장함에 따라 변경되며, 바우처나 해커톤의 프로모션 크레딧은 일반적으로 무료 모델에 한정되지 않고 전체 카탈로그에서 사용할 수 있습니다.
앞서 설명한 문제에서 중요한 부분은 그다음에 일어나는 일입니다. 모든 것은하나의 OpenAI 호환 엔드포인트를 통해 실행됩니다. 즉, 프로토타입에 사용하는 무료 모델과 배포 시 사용하는 최첨단 모델이 동일한 통합 방식입니다. 모델 필드의 문자열 변경일 뿐 마이그레이션이 아닙니다. 무료 티어가 축소되거나 모델 지원이 중단되면 모델 ID를 변경하면 됩니다. 비교가 필요할 때Gemini 3.6 Flash를DeepSeek V4 Flash와 자신의 프롬프트에서 비교하면 새로 가입할 필요 없이 바로 할 수 있습니다.
이것은 무료 API에 관한 글에서 라우터에 대한 정직한 홍보입니다: 우리가 무료보다 더 싸다는 것이 아니라, 무료 티어는 의존하기에 가장 변동성이 큰 것이며, 그 변동성의 비용이야말로 설계를 통해 없앨 가치가 있는 것입니다.

간략 버전
2026년의 무료 LLM API는 실제로 존재하며, 유용하고 사용할 가치가 있습니다. 프로토타이핑, 민감하지 않은 워크로드, 학습, 그리고 Flash급 모델이 완벽하게 처리하는 대규모 작업 유형에 적합합니다. 그러나 이는 프로덕션 전략이 아니며, 무료도 아닙니다.
하나를 기반으로 구축하기 전에, 요약이 아닌 제공업체 자체 문서에서 서면으로 세 가지 답변을 받으세요: 이 티어가 내 데이터로 학습하는지, 내 하루 요청 상한은 얼마인지, 그리고 내가 실제로 출시할 모델이 여기서 이용 가능한지?세 가지 모두에 답할 수 있고 여전히 그 제안이 마음에 든다면, 그것을 선택하세요. 답할 수 없다면, 당신은 가격을 매긴 것이 아닙니다 — 당신은 숫자 0만 보고 읽기를 멈춘 것입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
