Титульная карточка для статьи Qwen3.8-27B на Ollama: минималистичное окно терминала с командой «ollama run qwen3.8:27b» и мигающим курсором, три бейджа с надписями «загрузка 18 ГБ», «Q4_K_M по умолчанию» и «контекст 262K», а также подпись «бесплатно, на вашем оборудовании».
Guides & Insights

Qwen3.8-27B на Ollama: одна команда, четыре квантизации и какова настоящая цена «бесплатно»

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Запустите одной командой: ollama run qwen3.8:27b. Это и есть весь ответ на вопрос, которому посвящена эта страница. Qwen3.8 27B — плотная модель Alibaba с 27 миллиардами параметров, веса которой были выпущены 14 августа 2026 года под лицензией Apache 2.0, — на этой неделе появилась в библиотеке Ollama, и сборка по умолчанию уже представляет собой разумный квант Q4_K_M объёмом 18 ГБ (17 ГБ весов плюс 931 МБ визуального энкодера). Она полностью работает на 24 ГБ GPU при стандартной длине контекста, переходит на CPU, если видеокарта меньше, и ничего не стоит за токен.

Все данные здесь датированы 15 августа 2026 года. Характеристики взяты из карточки модели Qwen3.8 27B; размеры загрузок, теги и количество загрузок — с актуальной страницы библиотеки Ollama; результаты бенчмарков предоставлены Ali​baba и пока не имеют независимого подтверждения. Модель была выпущена несколько дней назад, поэтому всё, что может измениться, следует рассматривать как предварительное.

Однострочник, который действительно работает

Если Ollama уже установлена, вам осталось всего два слова:

ollama run qwen3.8:27b

Поддержка Ollama появилась в v0.32.12 — в примечаниях к выпуску прямо сказано: «Этот выпуск добавляет поддержку Qwe​n 3.8 27B». При первом запуске загружается сборка по умолчанию (около 18 ГБ, Q4_K_M), после чего вы попадаете в чат-REPL с включённым по умолчанию режимом размышлений. На странице библиотеки сборка указана с тегами возможностей «vision tools thinking 27b», что говорит о том, что возможности зрения и вызова инструментов встроены в одну и ту же загрузку. На момент написания на странице отображается более 40 000 загрузок и список тегов, который уже включает одиннадцать вариантов.

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

Два варианта, к которым вы действительно будете обращаться:

• ollama run qwen3.8:27b-mlx — сборка для Apple Silicon, тот же объём 18 ГБ, но скомпилирована для Metal; именно её примечание к выпуску Ollama оптимизирует «для максимальной производительности и качества вывода, подходящих для повторяющихся задач и агентов кодирования».

• ollama run qwen3.8:27b-q8_0 — 30-гигабайтный 8-битный квант, для тех, у кого есть видеопамять и кто хочет веса, максимально близкие к полной точности.

Что вы на самом деле скачиваете

В названии указано 27B, но полное количество параметров — 28B: плотная языковая модель на 27.3B плюс визуальный энкодер на 461M, который обеспечивает нативную поддержку ввода изображений и видео. Остальные основные характеристики — прямо из карточки модели:

• 64 слоя, размер скрытого слоя 5,120, словарь 248,320.

Гибридное внимание: 16 полных слоёв Gated Attention и 48 линейных слоёв Gated DeltaNet — сочетание 3:1 с перевесом в сторону линейных, именно поэтому модель на 27B может сохранять нативный контекст в 262 144 токена (расширяемый до 1M), не позволяя KV-кэшу поглотить целый дата-центр.

• Нативное понимание изображений и видео — «от диаграмм и документов STEM до видеороликов продолжительностью в несколько часов» — формулировка Ali​baba.

• Apache 2.0. Скачивайте, модифицируйте, продавайте продукт на его основе. Эта лицензия — тот юридический факт, на котором держится вся экономическая логика остальной части этой статьи.

Полноточный эталон — BF16, поэтому и существуют теги на 56 ГБ; каждый меньший тег — это обмен точности на размер, а собственные бенчмарки карточки модели — это то, чем вы расплачиваетесь.

Сначала выберите квант, затем проверьте VRAM, а не наоборот

Ollama предоставляет вам одиннадцать тегов, но выбор сводится к трем размерам.

18 GB — Q4_K_M (по умолчанию).Полностью помещается на видеокарту с 24 ГБ (класс RTX 4090 / 5090) при обычном контексте, а также на видеокарты с 16 ГБ при частичной выгрузке на процессор — медленнее, но работает. Это сборка для варианта «просто запустить».

30 ГБ — Q8_0. Веса почти полной точности: требуется примерно 40 ГБ видеопамяти, чтобы полностью оставаться на GPU. На 27B вы уже должны знать, зачем вам нужна дополнительная точность, прежде чем платить за неё.

56 ГБ — BF16. Эталонная сборка. Требуется оборудование класса H100 или 96 ГБ памяти. Никто не запускает это на потребительском GPU, и это нормально.

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

Число, которое сбивает людей с толку, — это KV-кэш. Загрузка 18 ГБ не означает, что 18 ГБ видеопамяти хватит для сессии с контекстом 262K — при длинном контексте кэш добавляет несколько гигабайт поверх весов, именно поэтому видеокарта на 24 ГБ спокойно потянет эту модель при контексте 8K–32K, но не при 262K. На карте с пограничным объёмом памяти снижайте контекст, а не квант.

Apple Silicon — это полноценная цель здесь

В {{1}}примечаниях к выпуску Ollama v0.32.12 отдельно упоминается macOS.{{/1}} Конкретно: {{2}}для ollama run qwen3.8:27b-mlx требуется около 18 ГБ унифицированной памяти{{/2}}, так что {{3}}Mac с 24 ГБ+{{/3}} {{4}}запускает её полностью на GPU с запасом под контекст.{{/4}} Также есть {{5}}тег mxfp8 MLX на 32 ГБ{{/5}} и {{6}}тег mlx-bf16 на 56 ГБ{{/6}} для {{7}}машин с 64–128 ГБ.{{/7}} {{8}}Если ваш Mac на M-серии{{/8}} {{9}}следил за новостями о настольных моделях{{/9}} — {{10}}это та сборка,{{/10}} {{11}}которую вы ждали.{{/11}}

Контекст: 262K в спецификации, но в кресле меньше

В карточке модели указано 262 144 нативных токена с возможностью расширения до 1M; на странице библиотеки Ollama то же окно указано как 256K. Оба значения верны — 262 144 — это 256K, умноженное на 1024, — но ни одно из них не означает, что вам нужно вводить это число в --num-ctx на карте с 24 ГБ. Кэш KV растёт примерно линейно с увеличением контекста, поэтому на потребительском оборудовании вы будете работать в диапазоне 16K–64K, а не 262K. Начните со значения по умолчанию в Ollama, увеличивайте --num-ctx только тогда, когда задача действительно требует этого, и помните, что показатель 1M требует механизма расширения плюс VRAM, чтобы его обеспечить.

Что всё ещё шатко — прочитайте это, прежде чем ставить на это

Независимых бенчмарков пока нет. Каждая цифра в карточке модели — это заявление Ali​baba по состоянию на 15 августа. Заявленные улучшения по сравнению с Qwen3.6-27B значительны — SWE-bench Pro 61.7 против 53.5, Terminal Bench 2.1 73.0 против 63.4, LiveCodeBench v6 90.3 против 83.9, GPQA Diamond 89.2 против 87.8 — и все они выглядят правдоподобно, но ни один из них не был воспроизведён на внешнем стенде. Не основывайте производственное решение только на них.

Стек визуального восприятия появился всего несколько дней назад. Ранний отчёт об ошибке (ollama issue #17753) показал, что сборка Q4 направляет визуальный ввод через парсер Qwen3.5 и не справляется с изображениями; это было исправлено в PR #17755 в течение нескольких дней, но мультимодальный путь в модели недельной давности — именно то, что стоит протестировать, прежде чем полагаться на него.

Сборка по умолчанию включает MTP. Тег q4_K_M также обозначает сборку с мультитокеновым предсказанием — более быстрое декодирование и причина, по которой «18 GB» и «27B» могут сосуществовать без противоречий.

Метки квантования могут вводить в заблуждение на Apple.Метки «mlx» и «nvfp4» для 18 ГБ различаются по квантованию (NVFP4 — это формат NVIDIA FP4), поэтому на Mac предпочитайте обычную сборку -mlx, если только вам специально не нужен вариант FP8/FP4 для GPU Blackwell.

Слово "Free" в том заголовке несет большую нагрузку.

Селф-хостинг 27B бесплатен за токен, но он не бесплатен. Честная формулировка — три варианта, которые стоят в разных валютах:

Запустите сами (Ollama). $0 за токен, офлайн, безлимитно, приватно — и оборудование ваше. Видеокарта на 24 ГБ или Mac с 18+ ГБ — это серьезное приобретение, как и электроэнергия и время на настройку. Это правильный выбор, когда Qwen3.8 27B становится повседневным инструментом.

Вызовите API за $0 с ограничением частоты запросов. OrcaRouter обслуживает Qwen3.8 27B на собственной инфраструктуре с нулевой стоимостью (идентификатор модели qwen/qwen3.8-27b-free, $0 за запрос, с ограничением частоты) — поскольку веса открыты, нет затрат поставщика за токен, которые нужно перекладывать на пользователя. Это правильный выбор, когда вы хотите попробовать модель, не покупая оборудование, чтобы протестировать релиз недельной давности.

Вызывайте безлимитный API. Та же модель без лимита запросов стоит $0.33 за миллион входных токенов и $2.40 за миллион выходных токенов на OrcaRouter (qwen/qwen3.8-27b, контекст 262K, ввод текста, изображений и видео). Это правильное решение, когда вам нужен производственный масштаб и вы не хотите нянчиться с GPU.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

Математика, которая определяет выбор между ними: при редком использовании выгоднее платить $0 или $0.33/$2.40, чем цену GPU; при ежедневном интерактивном использовании дешевле локально; при постоянной производственной нагрузке дешевле всего API, который не нужно поддерживать в живых. Требования приватности и автономной работы перемещают вас в первую колонку, что бы ни говорила математика.

Когда эта рекомендация ошибочна

Вам действительно нужен контекст 100K+. Модель может это сделать; ваша карта на 24 ГБ не может. При реально длинном контексте GPU на 40 ГБ+ или API с более длинным контекстом — не роскошь.

Вам нужно видео в продакшене сегодня. Ошибка парсера в vision-пути только что исправлена; видео в продакшене на мультимодальной модели недельной давности — это ставка, которую не стоит делать без запасного варианта.

Вам нужна конкурентность. Один потребительский GPU обрабатывает одну или две генерации за раз. 27B — это не серверная машина.

Вы работаете на оборудовании только с CPU. Модель 27B в 4-битном формате на CPU — это медленная демонстрация, а не инструмент. Пока у вас нет GPU, честный выбор — API.

Суть

Qwen3.8 27B на Ollama — это самый простой способ запустить современную 27B-модель, которую кто-либо уже выпустил: одна команда, стандартная версия на 18 ГБ, которая умещается на карте на 24 ГБ, первоклассная сборка для Apple Silicon и свобода Apache 2.0. Квант, который вам следует выбирать, почти всегда — это стандартный Q4_K_M — переходите на q8_0 только тогда, когда сможете измерить разницу. И «бесплатно» — условно: если вы будете пользоваться моделью изредка, API с ограничением скорости за $0 окажется свободнее, чем покупка оборудования; если же она станет вашим повседневным инструментом, локальная копия — самая дешёвая вещь, которая у вас есть. Проверяйте цифры, прежде чем строить на них свои планы — всё в этой статье было верно на 15 августа 2026 года, а эта модель меняется день ото дня.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube