Главная карточка с заголовком «Бесплатные LLM API в 2026 году» и подзаголовком «Что на самом деле бесплатно — и чем вы платите взамен», показывающая под заголовком ТРИ ВАЛЮТЫ три карточки: ВАШИ ДАННЫЕ (бесплатные тарифы могут обучаться на них), ВАШ ПОТОЛОК (суточный лимит запросов заканчивается) и ВАШ ТАРИФ (передовые модели — только платные).
Guides & Insights

that is oververbosity4

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Ищете бесплатный LLM API — и получаете список. Тринадцать провайдеров, пятнадцать провайдеров, таблица с логотипами, колонка зелёных галочек. Но почти ни один из этих списков не рассказывает о главном — о том, что определяет, пригодится ли вам бесплатный тариф: каждый бесплатный LLM API берёт с вас плату чем-то. Просто не деньгами.

Существует три валюты. Вы платите своими данными, своим потолком или своим уровнем модели — и обычно всеми тремя сразу. В этом материале мы разбираем каждую из них, опираясь на документацию самих провайдеров, а не на чужие таблицы, а затем отвечаем на вопрос, который такие списки пропускают: что происходит, когда бесплатный тариф заканчивается.

Валюта один: ваши данные

Именно это должно быть решающим для большинства команд, а этому пункту в лучшем случае уделяется лишь сноска.

Страница с ценами на API Gemini от Google необычно прямолинейна в этом вопросе. Для каждой модели с бесплатным тарифом на странице указано, что происходит с вашим контентом. На бесплатном тарифе строка гласит: «Контент используется для улучшения наших продуктов». На платном тарифе той же модели та же строка гласит: «Контент не используется для улучшения наших продуктов». Та же модель, та же конечная точка, тот же код — меняется только то, оставляет ли Google себе то, что вы отправили.

Mistral работает так же, но с другим значением по умолчанию. На La Plateforme входные и выходные данные используются для обучения моделей, если только вы не откажетесь от этого, и пользователи бесплатного тарифа могут отказаться — это переключатель в меню Privacy в Admin Console, и после подтверждения Mistral прекращает использовать ваши входные и выходные данные для обучения. Тарифные планы Team и Enterprise вообще не входят в обучающий пул.

Это различие важнее, чем кажется. Многие обзоры, которые вам встретятся, прямо утверждают, что бесплатный тариф Mistral требует от вас согласия на обучение. Это было верно для прежней политики, и сейчас это не так. Если вы оцениваете на основе записи в блоге шестимесячной давности, вы ошибётесь в обоих направлениях — считая провайдера безопасным, когда это не так, или исключая его, когда галочка могла бы решить эту проблему.

Практическое правило: если запрос содержит что-то, что вы не решились бы вставить в публичный форум, то бесплатный тариф не бесплатен. Записи клиентов, внутренний код, неопубликованные тексты о продуктах, всё, что подпадает под NDA — цена бесплатного тарифа здесь является проблемой управления данными, которую вы тихо создали, чтобы кто-то другой её нашёл.

Table titled 'What the free tier actually gives you' showing Groq's published free-plan limits — llama-3.1-8b-instant at 30 requests/min, 14,400 requests/day, 6,000 tokens/min, 500,000 tokens/day; llama-3.3-70b-versatile at 30 requests/min, 1,000 requests/day, 12,000 tokens/min, 100,000 tokens/day; whisper-large-v3 at 20 requests/min, 2,000 requests/day — alongside Google's free-tier Gemini model list and the pricing-page clause 'Content used to improve our products' on free versus 'not used' on paid.

Валюта вторая: ваш потолок

Бесплатные тарифы измеряются по большему числу параметров, чем ожидают люди, и вы упираетесь в тот, который заканчивается первым. Groq публикует лимиты бесплатного плана для каждой модели, и эта структура показательна:

Сопоставьте эти две строки моделей друг с другом. Одинаковое количество запросов в минуту, но более крупная модель даёт вам 1,000 запросов в день вместо 14,400 — сокращение в четырнадцать раз в обмен на повышение возможностей. При этом лимиты действуют на уровне организации, а не на пользователя, так что второй разработчик в том же аккаунте не получает отдельной квоты — он расходует вашу.

Дневной лимит — вот что тихо убивает проекты. 1000 запросов в день звучит щедро, пока не применишь это к чему-то реальному: чат с 50 пользователями по 20 обращений каждый — это весь твой день. Ночная пакетная задача, повторяющая попытки при сбое, может сжечь лимит ещё до завтрака. Ограничения в минуту можно обойти с помощью очереди. А дневной потолок — нет: остаётся только ждать полуночи.

Число, которое нужно рассчитать перед тем, как строить, — это не «есть ли бесплатный тариф», а «каков мой дневной бюджет запросов на пользователя, и на скольких пользователей этого хватит?» Если ответ меньше ста, вы делаете демо, и вам стоит понимать это с самого начала.

Валюта три: ваш уровень модели

Третья стоимость — это та, которая определяет, что вы действительно можете построить: передовые модели недоступны на бесплатных тарифах, и разрыв увеличивается.

Бесплатный тариф Google теперь охватывает класс Flash и модели эмбеддингов — Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemini 2.5 Flash, Gemini 2.5 Flash-Lite и Gemini 2.0 Flash. Линейка Pro в него не входит. Это осознанное сужение: модели серии Pro были переведены на платный доступ к API в 2026 году, и с тех пор бесплатный тариф включает только Flash и ниже.

Это не жалоба — модели класса Flash в 2026 году по-настоящему сильны, и для классификации, извлечения, маршрутизации, суммаризации и большинства retrieval-augmented-задач они являются правильным выбором, платите вы или нет. Но это означает, что бесплатный тариф не может ответить на вопрос, ответ на который вы больше всего хотите получить при оценке, а именно: «решает ли хорошая модель мой сложный случай?» Вы будете оценивать дешёвую модель и экстраполировать вверх, а такая экстраполяция часто ошибочна в обе стороны.

Тот, который действительно бесплатен за токен.

Существует категория, которую обзоры обычно упоминают и редко обдумывают: модели с открытым весом, которые вы запускаете самостоятельно. Скачайте веса, запустите их на собственном оборудовании — и предельная стоимость токена действительно равна нулю. Никаких лимитов запросов, дневных ограничений, пунктов об обучении или тарифов — всё это принадлежит вам.

Вы по сути перенесли стоимость из статьи расходов в статью фонда оплаты труда. Кто-то должен подбирать GPU, выбирать и настраивать стек для инференса, поддерживать его в актуальном состоянии, обрабатывать ночной вызов в 3 часа утра, когда падает пропускная способность, и переделывать всё это, когда через два месяца появляется более удачная контрольная точка. Для команды, которая уже управляет инфраструктурой, при больших объёмах это может быть самым дешёвым вариантом с большим отрывом. Для команды из трёх человек, выпускающей продукт, человеко-неделя, потраченная на инженерную обвязку инференса, обходится дороже, чем несколько лет счетов за API, которые она заменила.

Собственный хостинг — правильный ответ, когда у вас большие объёмы, требование конфиденциальности, не допускающее других решений, или существующая платформенная команда. Это неправильный ответ, когда на самом деле вам нужно было перестать думать об инференсе.

Decision guide titled 'Which free option fits', mapping four situations to approaches: prototyping with non-sensitive data to taking the vendor free tiers; sensitive data to not using a free tier that trains on inputs; high volume to self-hosting open weights; shipping to production to asking cost per token and outage behaviour instead of what is free.

Расходы, которые никто не заносит в таблицу: бесплатные тарифы не комбинируются.

Вот сценарий отказа, который на самом деле отнимает время у команд, — он возникает из-за слишком буквального следования советам о бесплатном тарифе.

Вы выбираете разумный путь. Бесплатный тариф Google для задач класса Flash. Бесплатный тариф другого провайдера для быстрого инференса на открытых весах. Третий — для речи. Каждый из них действительно бесплатен, и каждый по отдельности был хорошим решением. Шесть недель спустя вы держите в руках три API-ключа, три SDK, три режима ограничения частоты запросов, три биллинговых отношения и три разных варианта поведения при сбоях — и ваша логика повторных попыток, ваша наблюдаемость и ваш учёт затрат должны разбираться во всех них.

Затем один из них меняется. Провайдер сужает свой бесплатный тариф — как это произошло, когда модели Pro-класса стали платными. Ваш запасной путь никогда не тестировался, потому что он ни разу не срабатывал. Миграция, которую вы сейчас выполняете, — это не изменение конфигурации; это рефакторинг слоя, который вы создали, чтобы сгладить различия, и вы делаете это в условиях нехватки времени, потому что система уже в продакшене.

Бесплатный тариф был бесплатным. Привязка, которую вы накопили, чтобы получить его, бесплатной не была. Это и есть настоящая причина, по которой стоит заботиться о переносимости вашего слоя доступа: не идеология вендорной нейтральности, а тот факт, что бесплатные тарифы — самая нестабильная часть предложения любого провайдера, и разработка напрямую под три из них гарантирует, что в течение года вам придётся что-то переносить.

Что на самом деле делать

Если вы прототипируете и данные не чувствительны — берите бесплатные тарифы вендоров, и берите их без чувства вины. Они существуют именно для этого. С самого первого дня пишите интеграцию за одним собственным интерфейсом, чтобы смена провайдера была изменением конфигурации, а не рефакторингом.

Если данные конфиденциальны — не используйте бесплатный тариф, который обучается на ваших данных. Либо платите за тариф, где поставщик по контракту этого не делает (в Google это явно прописано в разделении бесплатной и платной версий), либо отключите обучение там, где провайдер позволяет это сделать на бесплатном плане, либо разверните собственную инфраструктуру. Четвёртого варианта нет, и обнаружить это после запуска обходится значительно дороже, чем счёт за API, которого вы пытались избежать.

Если вы оцениваете модели друг против друга — бесплатный тариф введёт вас в заблуждение, потому что в нём нет моделей, которые вы собираетесь использовать в продакшене. Оценивайте на тарифе, который планируете запускать в продакшене, на своих собственных промптах. Стоимость правильной оценки — несколько долларов; цена неправильного выбора — квартал.

Если вы выходите в продакшн — вопрос перестаёт быть «что бесплатно» и становится «какова цена за токен, и что произойдёт, если у этого провайдера случится сбой». Это разные вопросы с разными ответами, и бесплатный тариф не отвечает ни на один из них.

Где применяется OrcaRouter

OrcaRouter предоставляет постоянно обновляемый набор бесплатных ИИ-моделей, доступных по цене $0 за токен, а также бесплатные API-кредитыиз открытых раздач ваучеров, студенческих программ и партнёрских хакатонов. Для создания аккаунта и активации открытого предложения не требуется платёжный метод; состав бесплатных моделей меняется по мере появления новых моделей с открытым весом и промо-моделей, а промо-кредиты, полученные по ваучеру или на хакатоне, обычно можно тратить во всём каталоге, а не только на бесплатных моделях.

Важная для описанной выше проблемы часть — то, что происходит дальше. Всё работает через единый OpenAI-совместимый эндпоинт, поэтому бесплатная модель, на которой вы прототипируете, и передовая модель, с которой вы выпускаете продукт, — это одна и та же интеграция: изменение строки в поле model, а не миграция. Когда бесплатный тариф сужается или модель устаревает, вы меняете ID модели. Когда вам нужно сравнить Gemini 3.6 Flash с DeepSeek V4 Flash на своих промптах, вы делаете это, не регистрируясь ни на чём новом.

Это честный посыл для роутера в материале о бесплатных API: дело не в том, что мы дешевле бесплатного, а в том, что бесплатные тарифы — самое нестабильное, на чём можно строить, и стоимость этой нестабильности — именно то, от чего стоит избавиться на этапе проектирования.

Screenshot of the OrcaRouter offers page at www.orcarouter.ai/offers in English, headlined 'Free AI API credits & free AI models' with the subtitle about claiming credits from live voucher drops, student programs and partner hackathons then calling a rotating set of free AI models at $0, plus live counters for hackathons, credit drops and top deposit match.

Краткая версия

Бесплатные LLM API в 2026 году реальны, полезны, и их стоит использовать — для прототипирования, для неконфиденциальных рабочих нагрузок, для обучения и для широкого класса задач, с которыми модель класса Flash отлично справляется. Это не производственная стратегия, и они не бесплатны.

Прежде чем строить на одном из них, получите три ответа в письменном виде из документации самого провайдера, а не из сводки: обучается ли этот тариф на моих данных, каков мой потолок запросов в день и доступна ли здесь вообще модель, которую я на самом деле собираюсь выпускать? Если вы можете ответить на все три и вам всё ещё нравится сделка — берите её. Если не можете, вы её не оценили — вы просто увидели ноль и перестали читать.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно