
Как запустить Qwen3.8-27B-Uncensored локально: GGUF Quants, llama.cpp и Ollama
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
Чтобы запустить Qwen3.8-27B-Uncensored локально, загрузите gated-репозиторий GGUF orcarouter/Qwen3.8-27B-Uncensored-GGUF с Hugging Face, выберите квант по объёму вашей VRAM — Q4_K_M (16,8 ГБ) для GPU на 24 ГБ, IQ4_XS (15,3 ГБ) для GPU на 16 ГБ, Q3_K_M (13,5 ГБ), если нужен запас по контексту — и запустите его с актуальной сборкой llama.cpp, используя флаг --jinja, добавив --mmproj, если требуется поддержка зрения. Тот же файл импортируется в Ollama тремя командами. Это GGUF-версия abliterated-сборки Qwen3.8 27B, выпущенной 16 августа 2026 года, с сохранёнными в каждом кванте нативным контекстом на 262K, визуальным проектором и MTP-головой спекулятивного декодирования. Это исследовательский инструмент, а не ассистент: у него удалено поведение отказа, в нём нет встроенных защитных механизмов, а лицензия — Apache 2.0. Прежде чем скачивать, прочитайте предупреждение о безопасности внизу этой страницы — в этом и заключается смысл gated-репозитория.
Какой GGUF скачать, в зависимости от VRAM
Репозиторий содержит одну пару файлов полной точности и двенадцать квантованных файлов, так что решение о загрузке на самом деле зависит от объёма видеопамяти. Приведённые ниже числа — это размеры файлов, полученные из репозитория Hugging Face 2026-08-16.

Что на самом деле в репозитории
Репозиторий orcarouter/Qwen3.8-27B-Uncensored-GGUF содержит пятнадцать файлов модели: веса F16, разбитые на две части, двенадцать квантованных GGUF — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M и IQ4_XS — а также визуальный проектор mmproj. Это GGUF-экспорт той же abliterated-сборки, что и Qwen3.8-27B-Uncensored-FP8, переупакованный для локальных сред выполнения класса llama.cpp. Он наследует лицензию Apache 2.0 базовой модели и её родной контекст в 262 144 токена.
Три свойства сохраняются во всех квантах. Архитектура — qwen35 — гибридное внимание с 48 линейными слоями Gated DeltaNet и 16 слоями полного внимания; именно поэтому репозиторий отказывается загружаться в старых сборках llama.cpp, а KV-кэш остаётся небольшим. MTP (nextn) — голова спекулятивного декодирования сохраняется во всех квантах, как в K-quant, так и в IQ. А чат-шаблон — это Qwen Jinja, который нужно явно включить (см. ниже), иначе многоходовые диалоги сломаются.
Почему KV-кэш остаётся достаточно малым, чтобы иметь значение
Именно эта деталь делает локальный сценарий работающим. Из 64 слоёв только 16 используют полное внимание; остальные 48 используют линейное внимание Gated DeltaNet, которое не хранит обычный KV-кэш. Практический эффект, измеренный по оригинальному ранбуку этой архитектуры, — это KV-кэш примерно 2 ГБ при контексте 32K — около четверти того, что потребовалось бы обычной модели 27B. Вот почему файл Q4_K_M на 16,8 ГБ всё ещё помещается в видеокарту на 24 ГБ с длинным контекстным окном, и почему линейка несенсоренных GGUF-моделей работает на оборудовании, которое вообще не могло вместить чекпоинт BF16 на 55,6 ГБ.
Запустите это с помощью llama.cpp
llama.cpp — это предполагаемый путь. Вам нужна текущая сборка: основная ветка регистрирует архитектуру qwen35, а старые сборки полностью отказываются принимать файл. Форма команды, согласно примечаниям по использованию из карточки модели и руководству для этой архитектуры, такова:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
Это дает вам совместимый с OpenAI эндпоинт на localhost:8080. Для ввода изображений добавьте --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Замените Q4_K_M на квант, соответствующий вашей VRAM; флаги идентичны.
Запустите это с помощью Ollama
Ollama запускает тот же файл, импортируя его из Modelfile — это поддерживаемый способ добавить GGUF, которого нет в библиотеке. В каталоге, содержащем загруженный вами квант:
ИЗ ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
Сохраните эту строку как Modelfile, затем ollama create qwen3.8-27b-uncensored -f Modelfile и ollama run qwen3.8-27b-uncensored. Для vision добавьте строку mmproj в Modelfile (FROM ... Q4_K_M.gguf плюс путь к mmproj), и Ollama подключит проектор. Те же предостережения касаются --ctx и шаблона: установите размер контекста, который вы реально можете вместить, и помните, что модель с удалённым отказом отвечает без предохранительных барьеров между вами и выводом.
Что на самом деле изменило удаление отказа
В карточке модели публикуется набор тестов оценки безопасности для этой сборки. С отключённым мышлением доля отказов на стандартных бенчмарках с вредоносными запросами снижается с 64–99% на базовой модели до 0–6% на весах abliterated; с включённым мышлением отказы практически отсутствуют — 1,7% или меньше. Показатели способностей остаются в пределах ±1,3 пункта от базовой модели. Такова форма каждого релиза abliterated в этой линейке: отказы удалены, способности сохранены, и имеется оговорка: заметная часть ответов по-прежнему начинается с короткого дисклеймера — это артефакт обучения, а не отказ.
Обратная сторона — в этом и заключается весь смысл границы безопасности, описанной ниже: модель, которая никогда не отказывает, — это не лучший помощник, а объект иного рода. Это испытательный инструмент для измерения механизмов отказа и выяснения того, работает ли ваш собственный защитный барьер.
Что на самом деле с этим делать в исследовании
Три легитимных проекта, которые представляют собой санкционированное использование модели с удалённым отказом:
Когда эта сборка — неверный ответ
Если вам нужен обычный ассистент или что-то, что вы поставите перед конечными пользователями, это неправильная модель — в ней нет значимых встроенных ограничений, она будет выполнять запросы, которые базовая модель отклоняет, и Apache 2.0 не снимает с вас ответственность. Используйте для этого исходную выровненную модель Qwen3.8-27B. Если вы хотите обходить отказы в чат-боте, набор системных промптов даёт больше с меньшим риском, чем правка весов. А если у вас вообще нет GPU, но вы всё же хотите изучить модель, размещённая карточка obsidian/Qwen3.8-27B на OrcaRouter предоставляет ту же линию без цензуры по $0.40 за миллион входных токенов и $4.21 за миллион выходных, с тем же контекстом 262K; она ограничена для исследователей безопасности и ИИ-безопасности так же, как и репозиторий, и решение о модерации остаётся на вашей стороне. Эта карточка модели содержит информацию о ценах и бенчмарках.
Граница безопасности — прочтите это перед загрузкой

У этой модели существенно удалена защитная настройка безопасности (safety alignment). Она будет выполнять вредные, неэтичные, оскорбительные или незаконные запросы, которые оригинальная Qwen3.8-27B отказалась бы выполнять, и у неё нет значимых встроенных предохранителей. Она выпущена строго для легитимных исследований — изучения интерпретируемости, безопасности ИИ и механизмов отказов, red-teaming, оценки устойчивости и контролируемых экспериментов. Вы берёте на себя полную ответственность и обязательства за то, как вы её используете, и за всё, что она генерирует, и вы не должны развёртывать её для конечных пользователей или в производственной среде без добавления собственных уровней безопасности, модерации и предотвращения злоупотреблений. Авторы не несут ответственности за неправильное использование. Загрузка репозитория означает ваше согласие с этими условиями; лицензия — Apache 2.0.
Эта статья намеренно не содержит вредоносных промптов. Приведённые выше показатели отказов взяты из собственного набора средств оценки безопасности модели, указанного в её карточке (model card), — это правильный способ измерения модели данного класса: запустите стандартные бенчмарки отказов, изучите показатели и спроектируйте исследование на основе того, что они демонстрируют.
Источники и дата
Все приведённые выше факты были проверены 16 августа 2026 года. Список файлов и их размеры взяты из репозитория Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (создан 16 августа 2026 г.; архитектура qwen35; лицензия Apache 2.0; ограниченный доступ). Показатели отказов и возможностей взяты из набора тестов оценки безопасности карточки модели. Измерение KV-кэша (~2 ГБ при контексте 32K) взято из руководства OrcaRouter для этой архитектуры, How to Run Qwen 3.8 27B Locally. Стоимость хостинга и условия доступа взяты со страницы модели obsidian/Qwen3.8-27B, проверено в тот же день. Размеры квантованных файлов указаны в десятичных ГБ, как они хранятся на Hugging Face.
Для легитимных исследований, веса доступны на Hugging Face: Скачать с Hugging Face — без кредитной карты, запуск за 60 секунд.
