
Qwen3.8-27B на Ollama: одна команда, четыре квантизации и какова настоящая цена «бесплатно»
- obsidianНОВИНКАQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 за 1 млн токенов · 18 tok/s
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
Запустите одной командой: ollama run qwen3.8:27b. Это и есть весь ответ на вопрос, которому посвящена эта страница. Qwen3.8 27B — плотная модель Alibaba с 27 миллиардами параметров, веса которой были выпущены 14 августа 2026 года под лицензией Apache 2.0, — на этой неделе появилась в библиотеке Ollama, и сборка по умолчанию уже представляет собой разумный квант Q4_K_M объёмом 18 ГБ (17 ГБ весов плюс 931 МБ визуального энкодера). Она полностью работает на 24 ГБ GPU при стандартной длине контекста, переходит на CPU, если видеокарта меньше, и ничего не стоит за токен.
Все данные здесь датированы 15 августа 2026 года. Характеристики взяты из карточки модели Qwen3.8 27B; размеры загрузок, теги и количество загрузок — с актуальной страницы библиотеки Ollama; результаты бенчмарков предоставлены Alibaba и пока не имеют независимого подтверждения. Модель была выпущена несколько дней назад, поэтому всё, что может измениться, следует рассматривать как предварительное.
Однострочник, который действительно работает
Если Ollama уже установлена, вам осталось всего два слова:
ollama run qwen3.8:27b
Поддержка Ollama появилась в v0.32.12 — в примечаниях к выпуску прямо сказано: «Этот выпуск добавляет поддержку Qwen 3.8 27B». При первом запуске загружается сборка по умолчанию (около 18 ГБ, Q4_K_M), после чего вы попадаете в чат-REPL с включённым по умолчанию режимом размышлений. На странице библиотеки сборка указана с тегами возможностей «vision tools thinking 27b», что говорит о том, что возможности зрения и вызова инструментов встроены в одну и ту же загрузку. На момент написания на странице отображается более 40 000 загрузок и список тегов, который уже включает одиннадцать вариантов.

Два варианта, к которым вы действительно будете обращаться:
• ollama run qwen3.8:27b-mlx — сборка для Apple Silicon, тот же объём 18 ГБ, но скомпилирована для Metal; именно её примечание к выпуску Ollama оптимизирует «для максимальной производительности и качества вывода, подходящих для повторяющихся задач и агентов кодирования».
• ollama run qwen3.8:27b-q8_0 — 30-гигабайтный 8-битный квант, для тех, у кого есть видеопамять и кто хочет веса, максимально близкие к полной точности.
Что вы на самом деле скачиваете
В названии указано 27B, но полное количество параметров — 28B: плотная языковая модель на 27.3B плюс визуальный энкодер на 461M, который обеспечивает нативную поддержку ввода изображений и видео. Остальные основные характеристики — прямо из карточки модели:
• 64 слоя, размер скрытого слоя 5,120, словарь 248,320.
Гибридное внимание: 16 полных слоёв Gated Attention и 48 линейных слоёв Gated DeltaNet — сочетание 3:1 с перевесом в сторону линейных, именно поэтому модель на 27B может сохранять нативный контекст в 262 144 токена (расширяемый до 1M), не позволяя KV-кэшу поглотить целый дата-центр.
• Нативное понимание изображений и видео — «от диаграмм и документов STEM до видеороликов продолжительностью в несколько часов» — формулировка Alibaba.
• Apache 2.0. Скачивайте, модифицируйте, продавайте продукт на его основе. Эта лицензия — тот юридический факт, на котором держится вся экономическая логика остальной части этой статьи.
Полноточный эталон — BF16, поэтому и существуют теги на 56 ГБ; каждый меньший тег — это обмен точности на размер, а собственные бенчмарки карточки модели — это то, чем вы расплачиваетесь.
Сначала выберите квант, затем проверьте VRAM, а не наоборот
Ollama предоставляет вам одиннадцать тегов, но выбор сводится к трем размерам.
• 18 GB — Q4_K_M (по умолчанию).Полностью помещается на видеокарту с 24 ГБ (класс RTX 4090 / 5090) при обычном контексте, а также на видеокарты с 16 ГБ при частичной выгрузке на процессор — медленнее, но работает. Это сборка для варианта «просто запустить».
• 30 ГБ — Q8_0. Веса почти полной точности: требуется примерно 40 ГБ видеопамяти, чтобы полностью оставаться на GPU. На 27B вы уже должны знать, зачем вам нужна дополнительная точность, прежде чем платить за неё.
• 56 ГБ — BF16. Эталонная сборка. Требуется оборудование класса H100 или 96 ГБ памяти. Никто не запускает это на потребительском GPU, и это нормально.

Число, которое сбивает людей с толку, — это KV-кэш. Загрузка 18 ГБ не означает, что 18 ГБ видеопамяти хватит для сессии с контекстом 262K — при длинном контексте кэш добавляет несколько гигабайт поверх весов, именно поэтому видеокарта на 24 ГБ спокойно потянет эту модель при контексте 8K–32K, но не при 262K. На карте с пограничным объёмом памяти снижайте контекст, а не квант.
Apple Silicon — это полноценная цель здесь
В {{1}}примечаниях к выпуску Ollama v0.32.12 отдельно упоминается macOS.{{/1}} Конкретно: {{2}}для ollama run qwen3.8:27b-mlx требуется около 18 ГБ унифицированной памяти{{/2}}, так что {{3}}Mac с 24 ГБ+{{/3}} {{4}}запускает её полностью на GPU с запасом под контекст.{{/4}} Также есть {{5}}тег mxfp8 MLX на 32 ГБ{{/5}} и {{6}}тег mlx-bf16 на 56 ГБ{{/6}} для {{7}}машин с 64–128 ГБ.{{/7}} {{8}}Если ваш Mac на M-серии{{/8}} {{9}}следил за новостями о настольных моделях{{/9}} — {{10}}это та сборка,{{/10}} {{11}}которую вы ждали.{{/11}}
Контекст: 262K в спецификации, но в кресле меньше
В карточке модели указано 262 144 нативных токена с возможностью расширения до 1M; на странице библиотеки Ollama то же окно указано как 256K. Оба значения верны — 262 144 — это 256K, умноженное на 1024, — но ни одно из них не означает, что вам нужно вводить это число в --num-ctx на карте с 24 ГБ. Кэш KV растёт примерно линейно с увеличением контекста, поэтому на потребительском оборудовании вы будете работать в диапазоне 16K–64K, а не 262K. Начните со значения по умолчанию в Ollama, увеличивайте --num-ctx только тогда, когда задача действительно требует этого, и помните, что показатель 1M требует механизма расширения плюс VRAM, чтобы его обеспечить.
Что всё ещё шатко — прочитайте это, прежде чем ставить на это
• Независимых бенчмарков пока нет. Каждая цифра в карточке модели — это заявление Alibaba по состоянию на 15 августа. Заявленные улучшения по сравнению с Qwen3.6-27B значительны — SWE-bench Pro 61.7 против 53.5, Terminal Bench 2.1 73.0 против 63.4, LiveCodeBench v6 90.3 против 83.9, GPQA Diamond 89.2 против 87.8 — и все они выглядят правдоподобно, но ни один из них не был воспроизведён на внешнем стенде. Не основывайте производственное решение только на них.
• Стек визуального восприятия появился всего несколько дней назад. Ранний отчёт об ошибке (ollama issue #17753) показал, что сборка Q4 направляет визуальный ввод через парсер Qwen3.5 и не справляется с изображениями; это было исправлено в PR #17755 в течение нескольких дней, но мультимодальный путь в модели недельной давности — именно то, что стоит протестировать, прежде чем полагаться на него.
• Сборка по умолчанию включает MTP. Тег q4_K_M также обозначает сборку с мультитокеновым предсказанием — более быстрое декодирование и причина, по которой «18 GB» и «27B» могут сосуществовать без противоречий.
• Метки квантования могут вводить в заблуждение на Apple.Метки «mlx» и «nvfp4» для 18 ГБ различаются по квантованию (NVFP4 — это формат NVIDIA FP4), поэтому на Mac предпочитайте обычную сборку -mlx, если только вам специально не нужен вариант FP8/FP4 для GPU Blackwell.
Слово "Free" в том заголовке несет большую нагрузку.
Селф-хостинг 27B бесплатен за токен, но он не бесплатен. Честная формулировка — три варианта, которые стоят в разных валютах:
• Запустите сами (Ollama). $0 за токен, офлайн, безлимитно, приватно — и оборудование ваше. Видеокарта на 24 ГБ или Mac с 18+ ГБ — это серьезное приобретение, как и электроэнергия и время на настройку. Это правильный выбор, когда Qwen3.8 27B становится повседневным инструментом.
• Вызовите API за $0 с ограничением частоты запросов. OrcaRouter обслуживает Qwen3.8 27B на собственной инфраструктуре с нулевой стоимостью (идентификатор модели qwen/qwen3.8-27b-free, $0 за запрос, с ограничением частоты) — поскольку веса открыты, нет затрат поставщика за токен, которые нужно перекладывать на пользователя. Это правильный выбор, когда вы хотите попробовать модель, не покупая оборудование, чтобы протестировать релиз недельной давности.
• Вызывайте безлимитный API. Та же модель без лимита запросов стоит $0.33 за миллион входных токенов и $2.40 за миллион выходных токенов на OrcaRouter (qwen/qwen3.8-27b, контекст 262K, ввод текста, изображений и видео). Это правильное решение, когда вам нужен производственный масштаб и вы не хотите нянчиться с GPU.

Математика, которая определяет выбор между ними: при редком использовании выгоднее платить $0 или $0.33/$2.40, чем цену GPU; при ежедневном интерактивном использовании дешевле локально; при постоянной производственной нагрузке дешевле всего API, который не нужно поддерживать в живых. Требования приватности и автономной работы перемещают вас в первую колонку, что бы ни говорила математика.
Когда эта рекомендация ошибочна
• Вам действительно нужен контекст 100K+. Модель может это сделать; ваша карта на 24 ГБ не может. При реально длинном контексте GPU на 40 ГБ+ или API с более длинным контекстом — не роскошь.
• Вам нужно видео в продакшене сегодня. Ошибка парсера в vision-пути только что исправлена; видео в продакшене на мультимодальной модели недельной давности — это ставка, которую не стоит делать без запасного варианта.
• Вам нужна конкурентность. Один потребительский GPU обрабатывает одну или две генерации за раз. 27B — это не серверная машина.
• Вы работаете на оборудовании только с CPU. Модель 27B в 4-битном формате на CPU — это медленная демонстрация, а не инструмент. Пока у вас нет GPU, честный выбор — API.
Суть
Qwen3.8 27B на Ollama — это самый простой способ запустить современную 27B-модель, которую кто-либо уже выпустил: одна команда, стандартная версия на 18 ГБ, которая умещается на карте на 24 ГБ, первоклассная сборка для Apple Silicon и свобода Apache 2.0. Квант, который вам следует выбирать, почти всегда — это стандартный Q4_K_M — переходите на q8_0 только тогда, когда сможете измерить разницу. И «бесплатно» — условно: если вы будете пользоваться моделью изредка, API с ограничением скорости за $0 окажется свободнее, чем покупка оборудования; если же она станет вашим повседневным инструментом, локальная копия — самая дешёвая вещь, которая у вас есть. Проверяйте цифры, прежде чем строить на них свои планы — всё в этой статье было верно на 15 августа 2026 года, а эта модель меняется день ото дня.
