
Qwen3.8-27B GGUF: какой квант скачать для вашей видеокарты
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 143 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 293 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Скачайте пакет unsloth/Qwen3.8-27B-GGUF и подберите файл под ту карту, которая у вас действительно есть. Вот и весь ответ: GPU на 24 ГБ (RTX 4090 или 3090) стоит брать Q4_K_M на 17.1GB; GPU на 16 ГБ — IQ4_XS на 15.7GB (или Q3_K_M на 13.8GB, если нужен запас под контекст); GPU на 12 ГБ ограничен 2-битными файлами, UD-IQ2_XXS на 9.0GB, и это компромисс, на который нужно идти осознанно. Qwen3.8 27B — плотная 27-миллиардная модель от Alibaba, веса под Apache 2.0 выпущены 13–14 августа 2026 года — работает локально на удивление дёшево, потому что её гибридное внимание кеширует лишь 16 из 64 слоёв, так что 4-битная квантизация на 24 ГБ спокойно несёт 32K–64K токенов контекста. А GGUF — единственный путь с нулевыми предельными затратами: никакого API-ключа, никакого счёта за токены, никаких данных, покидающих вашу машину.
Об источниках: архитектура, контекстное окно и лицензия официальны и взяты из карточки модели Qwen3.8 27B на Hugging Face, проверено 15 августа 2026 года. Размеры GGUF взяты из репозиториев GGUF от unsloth и ggml-org в тот же день. Рекомендации по объёму VRAM на одну GPU — это официальная рекомендация unsloth. Оценки объёма KV-кэша в байтах и показатели токенов в секунду измерены сообществом в первые дни после выпуска, а не являются спецификациями производителя. Каждый упомянутый ниже бенчмарк основан на данных Alibaba и не воспроизведён.
Средство выбора файлов, одна строка на квант.
• UD-IQ2_XXS — 9.0GB — единственный комфортный вариант для карты на 12GB; ожидайте заметную потерю качества.
• UD-Q2_K_XL — 10,7 ГБ — для карт с 12 ГБ, при этом почти не остаётся места под контекст.
• Q3_K_M — 13,8 ГБ — 16-гигабайтные карты, которым нужен запас для контекста.
• IQ4_XS — 15,7 ГБ — 16 ГБ карты: самый большой квант, который помещается целиком.
• Q4_K_M — 17,1 ГБ — для карт с 24 ГБ: золотая середина и файл, на который ссылается эта статья.
• Q5_K_M — 19,8 ГБ — 24 ГБ, жертвуя запасом контекста ради небольшого прироста качества.
• Q6_K — 22,9 ГБ — влезает в 24 ГБ, если ужать; почти без потерь.
• Q8_0 — 29,0 ГБ — 32 ГБ, разделение на две карты или выгрузка на ЦП.
• BF16 — 54.7GB — серверные карты и конфигурации CPU с большим объёмом RAM; эталонная точность.
Два пакета, два размера Q4_K_M: у unsloth — 17,1 ГБ; у ggml-org — 19,0 ГБ. Пакет unsloth использует квантизацию Dynamic V3.0 (preview) для своих файлов UD-* и является тем, который большинство локальных приложений используют по умолчанию; пакет ggml-org поставляется со стандартными K-quants плюс отдельная голова multi-token-prediction, используемая для спекулятивного декодирования. Подходит любой Q4_K_M — разница составляет несколько сотен мегабайт и файл MTP.

Почему этот 27B помещается на картах, меньших, чем у большинства
Qwen3.8 27B имеет 64 слоя, но только 16 используют полное внимание. Остальные 48 используют линейное внимание Gated DeltaNet, которое поддерживает рекуррентное состояние фиксированного размера вместо растущего кэша ключей-значений. Собственная схема блоков в карточке модели — 3×(Gated DeltaNet → FFN) на каждую 1×(Gated Attention → FFN) — гибридное соотношение 3:1. Практический эффект: KV-кэш примерно вчетверо меньше того, что нужен обычной плотной модели на 27B при том же контексте. Измерения сообщества на этой неделе дали кэш около 0,5 ГБ при контексте 8K, 2,0 ГБ при 32K и 16,4 ГБ при полном нативном окне 262K. Это переворачивает обычный совет: большая часть вашего бюджета VRAM уходит на веса, а не на контекст, и карта на 24 ГБ может запускать Q4_K_M с контекстом 64K–96K без напряжения. Можно ещё больше уменьшить кэш с помощью флага --cache-type-k в llama.cpp, который квантует сам кэш.

Три подводных камня, которые собьют вас с толку в первый же день
• Старые сборки llama.cpp отклоняют этот файл. GGUF регистрирует новую архитектуру qwen35, поэтому нужна актуальная сборка — любая, выпущенная до недели релиза, отказывается загружать его с ошибкой архитектуры. Сначала обновите llama.cpp, прежде чем скачивать.
• Ловушка шаблона. Официальный чат-шаблон Jinja оборачивает каждый ход ассистента в блок think, даже когда трассировка рассуждений пуста; это создаёт вложенные блоки и усечённую историю в многоходовых чатах — выглядит так, будто модель забыла, что вы сказали. Запускайте llama.cpp с --jinja и предпочитайте пакет, в котором поставляется исправленный chat_template.jinja.
• Для работы со зрением нужен отдельный файл. Текст работает из коробки; изображения и видео молча ничего не делают, если вы дополнительно не загрузите проектор mmproj, примерно 0,9 ГБ. Его нет на странице репозитория GGUF от unsloth — возьмите его из базового репозитория или из пакета ggml-org. Если вы планируете передавать документы или скриншоты, добавьте --mmproj в команду сервера.
Запустите это: команды
llama.cpp, как только у вас будет актуальная сборка:
llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0
...и добавьте --mmproj Qwen3.8-27B-mmproj-bf16.gguf, если вам нужно зрение.
Ollama, если вам нужна запись в библиотеке: ollama pull qwen3.8:27b, затем ollama run qwen3.8:27b. LM Studio и Unsloth Desktop автоматически подхватывают шаблон чата и выгрузку в оперативную память — для первого запуска это наименее хлопотный путь.
Локально vs API: честная экономика
GGUF — это бесплатный путь: нулевые предельные затраты, никаких лимитов запросов, ничего не покидает вашу машину. Но в абсолютном выражении это не дешёвый вариант — GPU на 24 ГБ предоставляете вы (подержанная RTX 3090 или новая RTX 4090 плюс электроэнергия), а 2-битный файл на карте с 12 ГБ — это компромиссный опыт.
Маршрут API существует потому, что веса распространяются под Apache 2.0, поэтому предельные затраты на обслуживание близки к нулю, и разместить модель может любой. Qwen3.8 27B уже доступна на OrcaRouter сегодня по цене $0,33 за миллион входных токенов и $2,40 за миллион выходных — это прайс-лист провайдера, переданный без наценки — а поскольку веса открыты, также есть бесплатный тариф с ограничением частоты запросов, который взимает $0 за запрос и возвращает HTTP 429 при превышении лимита. Показательный месяц с 10 миллионами токенов при доле входных токенов 70% обходится примерно в $9,51 на платном тарифе. Если у вас уже есть GPU, локальный вариант выигрывает по затратам; если нет, аренда токенов выгоднее покупки карты для сайд-проекта.

Когда эта рекомендация неверна
Q4_K_M на 24 ГБ — это вариант по умолчанию, а не универсальное решение. Выбирайте что-то другое, когда:
• Вам нужно максимальное качество на сервере или рабочей станции — Q8_0 размером 29 ГБ или BF16 размером 54,7 ГБ с выгрузкой на CPU и в RAM, а не 4-битный файл.
• Вы используете карту Blackwell серии RTX 50 — вариант NVFP4 примерно в 1,5 раза быстрее при тех же 24 ГБ видеопамяти и использует кэш KV FP8 для более длинного контекста. На 5090 NVFP4 превосходит любой GGUF на этой модели.
• Вам нужен полный контекст в 262K — закладывайте примерно 16 ГБ кэша сверх весов; из-за этого карта на 24 ГБ опускается до Q3_K_M или вынуждает прибегнуть к квантизации KV.
• Вы полагаетесь на спекулятивное декодирование — выбирайте пакет ggml-org, в котором сохраняется голова многотокенного предсказания; в некоторых квантах её удаляют, чтобы сэкономить около 0,5 ГБ.
• У вас всего 12 ГБ — честный ответ: 27B в 2-битном квантовании заметно хуже, чем та же модель, запущенная как следует. Попробуйте бесплатный тариф API, прежде чем останавливаться на локальной 2-битной конфигурации; если качества хватает, GGUF может подождать, пока железо не догонит.
Итог
Qwen3.8 27B — редкая модель на 27B, которая помещается на карту с 24 ГБ без компромиссов: загрузка Q4_K_M размером 17,1 ГБ, актуальная сборка llama.cpp и KV-кэш, достаточно дешёвый, чтобы длинный контекст почти ничего не стоил. Скачайте этот файл, если у вас есть это железо, помните, что для работы со зрением нужен отдельный mmproj, и ожидайте ловушку с шаблоном, когда многоходовой диалог впервые покажется забывчивым. Если у вас нет этого железа, та же модель — это API за $0,33/$2,40 с бесплатным тарифом с ограничением по скорости, так что нет причин запускать 2-битный файл, который вас не устраивает. GGUF — это бесплатный путь; просто теперь он не единственный.
