Главная карточка-заголовок с надписью Qwen3.8-27B GGUF, подзаголовком «правильный квант для вашего GPU», значком загрузки и файловыми чипами для Q4_K_M 17.1GB и UD-IQ2 9.0GB.
Guides & Insights

Qwen3.8-27B GGUF: Какой квант скачать для вашего GPU

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Скачайте пакет unsloth/Qwen3.8-27B-GGUF и подберите файл под свою видеокарту. Вот и весь ответ: для GPU на 24 ГБ (RTX 4090 или 3090) следует взять Q4_K_M на 17.1GB; для GPU на 16 ГБ — IQ4_XS на 15.7GB (или Q3_K_M на 13.8GB, если нужен запас по контексту); GPU на 12 ГБ ограничен двухбитными файлами, UD-IQ2_XXS на 9.0GB, и это осознанный компромисс. Qwen3.8 27B — плотная модель Ali​baba на 27 миллиардов параметров (веса Apache 2.0 вышли 13–14 августа 2026 года) — запускается локально на удивление дёшево, потому что её гибридное внимание кэширует только 16 из 64 слоёв, поэтому модель с 4-битным квантованием на 24 ГБ легко тянет 32K–64K токенов контекста. А GGUF — единственный путь с нулевой предельной стоимостью: ни API-ключа, ни платы за токен, ни передачи данных с вашей машины.

{{1}}Об источниках:{{/1}} {{2}}архитектура, контекстное окно и лицензия — официальные данные из карточки модели Qwen3.8 27B на Hugging Face, проверено 15 августа 2026 года.{{/2}} {{3}}Размеры GGUF-файлов взяты из GGUF-репозиториев unsloth и ggml-org в тот же день.{{/3}} {{4}}Рекомендации по объёму видеопамяти на один GPU — официальные рекомендации unsloth.{{/4}} {{5}}Оценки размера KV-кэша в байтах и показатели токенов в секунду измерены сообществом в первые дни после релиза, а не являются спецификациями производителя.{{/5}} {{6}}Каждый упомянутый ниже бенчмарк заявлен Ali​baba и не был независимо воспроизведён.{{/6}}

Файловый пикер: одна строка на квант

UD-IQ2_XXS — 9.0 ГБ — единственный комфортный вариант для карты на 12 ГБ; ожидайте заметной потери качества.

UD-Q2_K_XL — 10.7GB — для карт на 12GB, контекста почти не остаётся.

Q3_K_M — 13.8GB — для видеокарт с 16GB, которым нужен запас под контекст.

IQ4_XS — 15.7GB — карты на 16GB: самый большой квант, помещающийся целиком.

Q4_K_M — 17.1GB — карты на 24 ГБ: оптимальный вариант, и именно этот файл рекомендует статья.

Q5_K_M — 19.8GB — 24GB, жертвуя запасом контекста ради небольшого прироста качества.

Q6_K — 22.9 ГБ — помещается в 24 ГБ, если постараться; почти без потерь.

Q8_0 — 29.0 ГБ — 32 ГБ, разделение на две карты или выгрузка на CPU.

BF16 — 54.7GB — серверные карты и CPU-конфигурации с большим объемом ОЗУ; эталонная точность.

Два пакета, два размера Q4_K_M: у unsloth — 17.1 ГБ; у ggml-org — 19.0 ГБ. Пакет unsloth использует квантование Dynamic V3.0 (preview) для своих файлов UD-* и является тем, который большинство локальных приложений выбирают по умолчанию; пакет ggml-org поставляется со стандартными K-quants плюс отдельная голова multi-token-prediction, используемая для спекулятивного декодирования. Любой Q4_K_M работает — разница в несколько сотен мегабайт и файле MTP.

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

Почему этот 27B умещается на карты меньшего размера, чем большинство.

Модель Qwen3.8 27B имеет 64 слоя, но только 16 из них используют полное внимание. Остальные 48 используют линейное внимание Gated DeltaNet, которое хранит рекуррентное состояние фиксированного размера вместо растущего кэша ключей и значений. Схема блоков, указанная в карточке модели, — это 3×(Gated DeltaNet → FFN) на каждые 1×(Gated Attention → FFN) — гибридное соотношение 3:1. Практический эффект: KV-кэш занимает примерно четверть от того, что требуется обычной плотной модели 27B для того же контекста. Измерения сообщества на этой неделе показали, что кэш составляет около 0,5 ГБ при контексте 8K, 2,0 ГБ при 32K и 16,4 ГБ при полном нативном окне 262K. Это переворачивает обычные рекомендации: большая часть вашего бюджета VRAM уходит на веса, а не на контекст, и видеокарта на 24 ГБ может запустить Q4_K_M с контекстом 64K–96K без проблем. Можно ещё уменьшить кэш с помощью флага --cache-type-k в llama.cpp, который квантизует сам кэш.

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

Три ловушки, которые заставят вас споткнуться в первый же день

Старые сборки llama.cpp отклоняют файл.GGUF регистрирует новую архитектуру qwen35, поэтому вам нужна актуальная сборка — любые сборки, выпущенные до недели релиза, отказываются загружать её с ошибкой архитектуры. Сначала обновите llama.cpp, а затем скачивайте.

Ловушка шаблона. Официальный Jinja chat-шаблон оборачивает каждый ответ ассистента в блок think, даже когда цепочка рассуждений пуста, что приводит к вложенным блокам и усечённой истории в многоходовых чатах — выглядит так, будто модель забыла, что вы сказали. Запускайте llama.cpp с --jinja и предпочитайте пакет, поставляемый с исправленным chat_template.jinja.

Vision требует отдельного файла. Текст работает сразу; изображения и видео молча ничего не делают, если не загрузить также проектор mmproj, примерно 0,9 ГБ. Он не указан на странице репозитория GGUF unsloth — возьмите его из базового репозитория или из пакета ggml-org. Если вы планируете передавать документы или скриншоты, добавьте --mmproj к команде сервера.

Запустите: команды

llama.cpp, если у вас есть актуальная сборка:

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

...и добавьте --mmproj Qwen3.8-27B-mmproj-bf16.gguf, если вам нужна поддержка изображений.

Ollama, если нужна запись в библиотеке: ollama pull qwen3.8:27b, затем ollama run qwen3.8:27b. LM Studio и Unsloth Desktop автоматически подхватывают шаблон чата и разгрузку оперативной памяти — это самый простой путь для первого запуска.

Локально vs API: честная экономика

GGUF — это бесплатный путь: нулевые предельные издержки, никаких лимитов на запросы, ничего не покидает вашу машину. В абсолютном выражении это не дешёвый путь — вы предоставляете GPU на 24 ГБ (подержанный RTX 3090 или новый RTX 4090, плюс электроэнергия), а 2-битный файл на карте на 12 ГБ — это ухудшенный опыт.

API-маршрут существует потому, что веса имеют лицензию Apache 2.0, поэтому предельные затраты на обслуживание почти нулевые, и любой может разместить их у себя. Qwen3.8 27B уже доступен на OrcaRouter по цене $0.33 за миллион входных токенов и $2.40 за миллион выходных — это цена провайдера без наценки — а поскольку веса открыты, есть также бесплатный тариф с ограничением частоты запросов, который взимает $0 за запрос и возвращает HTTP 429 при превышении лимита. Репрезентативный месяц с 10 миллионами токенов при 70% доле входных данных обойдётся примерно в $9.51 на платном тарифе. Если у вас уже есть GPU, локальный запуск выгоднее по стоимости; если нет — аренда токенов лучше, чем покупка видеокарты для побочного проекта.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

Когда эта рекомендация ошибочна

Q4_K_M на 24GB — это значение по умолчанию, а не универсальное решение. Выбирайте что-то другое, когда:

Вам нужно максимальное качество на сервере или рабочей станции — Q8_0 на 29GB или BF16 на 54.7GB с выгрузкой на CPU и RAM, а не 4-битный файл.

Вы используете видеокарту Blackwell RTX 50-й серии — вариант NVFP4 примерно в 1.5× быстрее в тех же 24 ГБ видеопамяти и использует FP8 KV-кэш для более длинного контекста. На 5090 NVFP4 превосходит любой GGUF на этой модели.

Вам нужен полный контекст 262K — закладывайте примерно 16 ГБ кэша сверх весов; это опускает 24-ГБ карту до Q3_K_M или вынуждает использовать квантование KV.

Вы полагаетесь на спекулятивное декодирование — выберите пакет ggml-org, который сохраняет голову множественного предсказания токенов; некоторые квантованные версии удаляют её, чтобы сэкономить около 0,5 ГБ.

У вас всего 12GB — честный ответ: 2-битная модель 27B заметно хуже, чем та же модель, запущенная правильно. Попробуйте бесплатный API-тариф, прежде чем решиться на локальную 2-битную установку; если этого достаточно, GGUF может подождать, пока железо не догонит.

Суть

Qwen3.8 27B — это редкая модель 27B, которая помещается на карту 24GB без компромиссов: загрузка Q4_K_M размером 17.1GB, актуальная сборка llama.cpp и KV-кэш, достаточно дешёвый, чтобы длинный контекст стоил почти ничего. Скачайте этот файл, если у вас есть подходящее железо; помните, что для vision требуется отдельный mmproj, и ожидайте шаблонную ловушку, когда многоходовой диалог впервые покажется забывчивым. Если у вас нет такого железа, эта же модель доступна через API за $0.33/$2.40 с бесплатным тарифом с ограничением частоты запросов, так что нет причин запускать 2-битный файл, который вас не устраивает. GGUF — это бесплатный путь; просто он больше не единственный.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube