Песочные часы на пустом пьедестале модели — веса Qwen3.8-27B не были выпущены, поэтому бесплатного API не может существовать.
Guides & Insights

Бесплатный API Qwen 3.8 27B: пока нет — что запустить вместо этого

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Нет — по состоянию на 12 августа 2026 года бесплатного API Qwen3.8-27B не существует, как и платного. Модель была анонсирована 3 августа с обещанием открытых весов на Hugging Face и ModelScope «на неделе 10 августа», но в официальной организации Qwen до сих пор нет репозитория Qwen3.8. Пока веса не выложены, никто не может разместить Qwen3.8-27B, так что «бесплатно» неактуально. Вот три пути к бесплатному доступу, когда веса появятся (и сколько каждый из них на самом деле стоит), а также модели, которые вы можете бесплатно запускать локально уже сегодня.

Бесплатного API пока нет — веса служат воротами.

3 августа 2026 года Alibaba анонсировала семейство Qwen3.8: модель Qwen3.8-Max с 2,4 триллиона параметров (около 95 миллиардов активных параметров, контекст на 1 миллион токенов, цена 2 доллара за миллион входных и 6 долларов за миллион выходных токенов в Alibaba Cloud Model Studio) и плотную модель Qwen3.8-27B для одной машины. Обе модели были обещаны с открытыми весами на Hugging Face и ModelScope уже на той же неделе.

Это обещание уже просрочено на два дня. Я напрямую проверил Hugging Face 12 августа: в официальной организации Qwe​n нет ни одного репозитория Qwen3.8. Репозитории Qwen3.8-27B-GGUF, -FP8, -NVFP4A16 и -NInfer, которые появляются в поиске моделей, — это карточки-заглушки: ноль файлов весов, загрузки в одну цифру, карточки моделей, в которых буквально написано «зарезервировано перед выходом Qwe​n/Qwen3.8-27B». Не воспринимайте их как доказательство существования модели; это люди, бронирующие парковочные места.

Есть две вещи, которые нельзя предполагать. Во-первых, лицензия: для Qwen3.8-27B не названа ни одна. Недавние открытые веса Qwen выходили под лицензией Tongyi Qianwen, чей пункт о 100 миллионах активных пользователей в месяц запускает разговоры о коммерческой лицензии при масштабировании — Apache 2.0 не является безопасным вариантом по умолчанию. Во-вторых, характеристики: Alibaba не публиковала ни таблицы бенчмарков, ни контекстного окна, ни подтверждённых требований к оборудованию для 27B. Всё, что сегодня о ней повторяют, — это проекция.

Мы рассмотрели предрелизный чек-лист — что подтверждено, что остаётся слухами, что проверить перед загрузкой — в Qwen3.8-27B Open Weights: What We Know Before the Drop. Эта статья посвящена тому, что та публикация не охватила: как «бесплатно» будет работать на самом деле после выхода модели.

После того как груз сброшен: три пути к свободе и чем каждый из них обходится на самом деле

«Бесплатно» никогда не бывает бесплатным. Все три пути к бесплатной Qwen3.8-27B переносят затраты куда-то ещё; разница лишь в том, куда они попадают. Модель 27B — плотная: все её ~27 миллиардов параметров активны на каждом токене, поэтому затраты ниже — это про реальное железо, а не про маркетинг.

Three routes to a free Qwen3.8-27B API after the weights drop: run it yourself, a hosted free tier, or OrcaRouter's planned free tier — and the real cost of each.

Вариант 1: Запустите сами — бесплатно по деньгам, цена — в оборудовании

Единственный маршрут, где «бесплатно» становится буквальной правдой после покупки железа. Сооснователь Unsloth Дэниел Хан ожидает, что 27B будет работать примерно в 17 ГБ видеопамяти на момент релиза — это цель, а не заявленная спецификация. Используя измеренную лестницу квантования Qwen3.6-27B как прокси: Q4_K_M ложится примерно в 16 ГБ, Q6_K — около 21 ГБ, FP8 — около 27 ГБ, а полный BF16 — около 54–56 ГБ. Реалистичный минимум сегодня — карта на 24 ГБ: RTX 3090, RTX 4090 или класс A6000 — на Q4.

Время решает: официальные веса с vLLM или SGLang обычно работают в течение нескольких дней после релиза, а GGUF- и AWQ-квантизации от сообщества отстают на одну-две недели, так что «скачать и запустить» в стиле Ollama в день выхода не появится. Скрытые издержки — электроэнергия, тихий компьютер и ваше время. Выигрыш — приватность (ничего не покидает ваш компьютер) и нулевые предельные издержки, которые дают накопительный эффект, если вы используете GPU и для других моделей.

Путь 2: Хостинговые бесплатные тарифы — бесплатны деньгами, но оплачиваются ограничениями

Как только веса будут опубликованы, ожидайте оценочную квоту от Alibaba Cloud и бесплатные тарифы от обычных serverless-хостингов. Ожидаемая модель — та же, что Alibaba уже использует для Qwen3.8-Max: квота для новых пользователей в 1M токенов, только регион Сингапур, срок действия 90 дней, без переноса остатка — а токены рассуждений тарифицируются как выходные, так что модель, которая рассуждает по умолчанию, может сжечь весь лимит за выходные прототипирования. На самом деле вы платите ограничениями скорости, привязкой к региону, сроком действия и тем, что ваши запросы уходят третьей стороне. Бесплатный тариф — это возможность оценить модель, а не место для её развёртывания.

Вариант 3: бесплатный тариф OrcaRouter — запланирован, но не запущен

Поскольку поисковый запрос буквально «бесплатно», мы будем предельно ясны: OrcaRouter планирует бесплатный тариф для Qwen3.8-27B после выхода весов. Он ещё не запущен. Нет конечной точки API для вызова, и я не собираюсь вставлять пример-заглушку. Мы сделаем анонс, когда будет что анонсировать. Что мы действительно размещаем сегодня — это Qwen3.8-Max по цене $2/$6 за 1 миллион токенов без наценки — а 27B нет на платформе, потому что его пока никто не может обслуживать.

Что можно использовать бесплатно прямо сейчас

Если ваша потребность — «открытая модель класса 27B, которую можно запускать без оплаты», ждать не обязательно. Честный ответ на том же уровне — Qwen3.6-27B, прямой предшественник модели, которую вы ждёте.

Comparison of Qwen3.6-27B and Nemotron 3.5 Lightning 30B A3B, which you can run free today, against Qwen3.8-27B, which is not yet released.

Qwen3.6-27B выпущена под лицензией Apache 2.0: это плотная модель на 27,8 млрд параметров с контекстом 262K и нативным вводом текста, изображений и видео. Q4_K_M GGUF весит около 16,5 ГБ и работает со скоростью примерно 25 токенов в секунду на потребительской видеокарте с 24 ГБ памяти (16–18 токенов в секунду на M4 Max). Заявленные вендором показатели из карточки модели: SWE-Bench Verified 77,2, MMLU-Pro 86,2, AIME 2026 94,1, GPQA Diamond 87,8 и MMMU 82,9. Если Qwen3.8-27B — это «27B», то Qwen3.6-27B — тот самый 27B, который можно пощупать уже сегодня: то же семейство, та же плотная архитектура, уже открытый.

Nemotron 3.5 Lightning 30B A3B — это другая форма, тоже бесплатная: выпущена 11 августа 2026 года под лицензией OpenMDW 1.1 от NVIDIA. Это модель Mixture-of-Experts с общим объёмом 30B и ~3B активными параметрами, гибридной архитектурой Mamba-2 и контекстом до 1M. Контрольные точки NVFP4 весят около 21,6 ГБ, а Q4 GGUF — около 25 ГБ. Ей нужна видеокарта от 24 ГБ, потому что все 30 миллиардов параметров находятся в памяти, хотя на токен активируется только около 3 миллиардов. Согласно первым сообщениям, она выдаёт около 45 токенов в секунду на одной видеокарте. Она создана для слоя выполнения агентов — вызовы инструментов, проверка, форматирование — а не для передовых рассуждений. Если ваша нагрузка — это высокообъёмная черновая работа агентов, она может превзойти плотную модель 27B в вашей реальной задаче.

И если вам нужна именно бесплатная облачная API сегодня, а не локальная установка, единственный честный «бесплатный» вариант — это квота Alibaba Qwen3.8-Max: 1 млн токенов, регион Сингапур, 90 дней. Это не 27B, и это оценочный лимит, а не сервис — используйте его, чтобы опробовать поведение Qwen3.8 сейчас, а затем переходите дальше.

Когда этот совет ошибочен

Если у вас уже есть GPU с 24+ ГБ, подход «подождать бесплатных тарифов» для вас неверен. В день, когда выйдут веса, vLLM на официальных весах — это и есть ваш бесплатный тариф; вы ждали бы удобство, которое вам не нужно. Повремените около двух недель, только если вам нужна именно отполированная линейка квантования GGUF.

Если вы прототипируете, опираясь на контракт API, предоставляемые бесплатные квоты (когда они появятся у 27B) могут стоить дешевле, чем ваше время — даже с учётом 90-дневного срока действия и ограничения по региону, аренда GPU-бокса на неделю прототипирования обычно оказывается более дорогим вариантом.

Если лицензия окажется Tongyi Qianwen, а не Apache, «свободные веса» не будут означать свободу коммерциализации выше порога в 100 миллионов MAU. Прочитайте файл LICENSE в самом репозитории, прежде чем строить что-либо на его основе — это самый распространённый способ, при котором «свободные открытые веса» превращаются в счёт.

И если Alibaba снова перенесёт дату — а она уже на два дня позже обещанной — то с каждой прошедшей неделей Qwen3.6-27B становится правильным выбором, а не временным решением.

A timeline from announcement to free local run of Qwen3.8-27B.

Суть

Не существует бесплатного API Qwen3.8-27B, потому что Qwen3.8-27B {{1}}нигде не существует{{/1}}. Когда веса выйдут, {{2}}три бесплатных пути{{/2}} будут такими: самостоятельное размещение (платите железом), {{3}}бесплатные тарифы с хостингом{{/3}} (платите ограничениями) и запланированный бесплатный тариф OrcaRouter — который ещё не запущен, и мы сообщим, когда это произойдёт. {{4}}Сегодня самое близкое к бесплатному — Qwen3.6-27B на вашем собственном оборудовании{{/4}}. Ожидание ничего вам не стоит, кроме 27B; {{5}}запуск предыдущей версии ничего вам не стоит, кроме GPU, который вы тем временем можете задействовать для всего остального{{/5}}.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно