
Как запустить Qwen3.8-27B-Uncensored локально: GGUF Quants, llama.cpp и Ollama
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Чтобы запустить Qwen3.8-27B-Uncensored локально, загрузите gated-репозиторий GGUF orcarouter/Qwen3.8-27B-Uncensored-GGUF с Hugging Face, выберите квант по объёму вашей VRAM — Q4_K_M (16,8 ГБ) для GPU на 24 ГБ, IQ4_XS (15,3 ГБ) для GPU на 16 ГБ, Q3_K_M (13,5 ГБ), если нужен запас по контексту — и запустите его с актуальной сборкой llama.cpp, используя флаг --jinja, добавив --mmproj, если требуется поддержка зрения. Тот же файл импортируется в Ollama тремя командами. Это GGUF-версия abliterated-сборки Qwen3.8 27B, выпущенной 16 августа 2026 года, с сохранёнными в каждом кванте нативным контекстом на 262K, визуальным проектором и MTP-головой спекулятивного декодирования. Это исследовательский инструмент, а не ассистент: у него удалено поведение отказа, в нём нет встроенных защитных механизмов, а лицензия — Apache 2.0. Прежде чем скачивать, прочитайте предупреждение о безопасности внизу этой страницы — в этом и заключается смысл gated-репозитория.
Какой GGUF скачать, в зависимости от VRAM
Репозиторий содержит одну пару файлов полной точности и двенадцать квантованных файлов, так что решение о загрузке на самом деле зависит от объёма видеопамяти. Приведённые ниже числа — это размеры файлов, полученные из репозитория Hugging Face 2026-08-16.

Что на самом деле в репозитории
Репозиторий orcarouter/Qwen3.8-27B-Uncensored-GGUF содержит пятнадцать файлов модели: веса F16, разбитые на две части, двенадцать квантованных GGUF — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M и IQ4_XS — а также визуальный проектор mmproj. Это GGUF-экспорт той же abliterated-сборки, что и Qwen3.8-27B-Uncensored-FP8, переупакованный для локальных сред выполнения класса llama.cpp. Он наследует лицензию Apache 2.0 базовой модели и её родной контекст в 262 144 токена.
Три свойства сохраняются во всех квантах. Архитектура — qwen35 — гибридное внимание с 48 линейными слоями Gated DeltaNet и 16 слоями полного внимания; именно поэтому репозиторий отказывается загружаться в старых сборках llama.cpp, а KV-кэш остаётся небольшим. MTP (nextn) — голова спекулятивного декодирования сохраняется во всех квантах, как в K-quant, так и в IQ. А чат-шаблон — это Qwen Jinja, который нужно явно включить (см. ниже), иначе многоходовые диалоги сломаются.
Почему KV-кэш остаётся достаточно малым, чтобы иметь значение
Именно эта деталь делает локальный сценарий работающим. Из 64 слоёв только 16 используют полное внимание; остальные 48 используют линейное внимание Gated DeltaNet, которое не хранит обычный KV-кэш. Практический эффект, измеренный по оригинальному ранбуку этой архитектуры, — это KV-кэш примерно 2 ГБ при контексте 32K — около четверти того, что потребовалось бы обычной модели 27B. Вот почему файл Q4_K_M на 16,8 ГБ всё ещё помещается в видеокарту на 24 ГБ с длинным контекстным окном, и почему линейка несенсоренных GGUF-моделей работает на оборудовании, которое вообще не могло вместить чекпоинт BF16 на 55,6 ГБ.
Запустите это с помощью llama.cpp
llama.cpp — это предполагаемый путь. Вам нужна текущая сборка: основная ветка регистрирует архитектуру qwen35, а старые сборки полностью отказываются принимать файл. Форма команды, согласно примечаниям по использованию из карточки модели и руководству для этой архитектуры, такова:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
Это дает вам совместимый с OpenAI эндпоинт на localhost:8080. Для ввода изображений добавьте --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Замените Q4_K_M на квант, соответствующий вашей VRAM; флаги идентичны.
Запустите это с помощью Ollama
Ollama запускает тот же файл, импортируя его из Modelfile — это поддерживаемый способ добавить GGUF, которого нет в библиотеке. В каталоге, содержащем загруженный вами квант:
ИЗ ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
Сохраните эту строку как Modelfile, затем ollama create qwen3.8-27b-uncensored -f Modelfile и ollama run qwen3.8-27b-uncensored. Для vision добавьте строку mmproj в Modelfile (FROM ... Q4_K_M.gguf плюс путь к mmproj), и Ollama подключит проектор. Те же предостережения касаются --ctx и шаблона: установите размер контекста, который вы реально можете вместить, и помните, что модель с удалённым отказом отвечает без предохранительных барьеров между вами и выводом.
Что на самом деле изменило удаление отказа
В карточке модели публикуется набор тестов оценки безопасности для этой сборки. С отключённым мышлением доля отказов на стандартных бенчмарках с вредоносными запросами снижается с 64–99% на базовой модели до 0–6% на весах abliterated; с включённым мышлением отказы практически отсутствуют — 1,7% или меньше. Показатели способностей остаются в пределах ±1,3 пункта от базовой модели. Такова форма каждого релиза abliterated в этой линейке: отказы удалены, способности сохранены, и имеется оговорка: заметная часть ответов по-прежнему начинается с короткого дисклеймера — это артефакт обучения, а не отказ.
Обратная сторона — в этом и заключается весь смысл границы безопасности, описанной ниже: модель, которая никогда не отказывает, — это не лучший помощник, а объект иного рода. Это испытательный инструмент для измерения механизмов отказа и выяснения того, работает ли ваш собственный защитный барьер.
Что с этим на самом деле делать в исследованиях
Три легитимных проекта, которые представляют собой санкционированное использование модели с удалённым отказом:
Когда эта сборка — неверный ответ
Если вам нужен обычный ассистент или что-то, что вы поставите перед конечными пользователями, это неправильная модель — в ней нет значимых встроенных ограничений, она будет выполнять запросы, которые базовая модель отклоняет, и Apache 2.0 не снимает с вас ответственность. Используйте для этого исходную выровненную модель Qwen3.8-27B. Если вы хотите обходить отказы в чат-боте, набор системных промптов даёт больше с меньшим риском, чем правка весов. А если у вас вообще нет GPU, но вы всё же хотите изучить модель, размещённая карточка obsidian/Qwen3.8-27B на OrcaRouter предоставляет ту же линию без цензуры по $0.40 за миллион входных токенов и $4.21 за миллион выходных, с тем же контекстом 262K; она ограничена для исследователей безопасности и ИИ-безопасности так же, как и репозиторий, и решение о модерации остаётся на вашей стороне. Эта карточка модели содержит информацию о ценах и бенчмарках.
Граница безопасности — прочитайте это перед загрузкой

У этой модели в значительной степени удалено выравнивание безопасности. Она будет выполнять вредоносные, неэтичные, оскорбительные или незаконные запросы, от которых отказалась бы исходная Qwen3.8-27B, и у неё нет сколько-нибудь значимых встроенных ограничений. Она выпущена строго для законных исследований — интерпретируемости, изучения безопасности ИИ и механизмов отказа, ред-тиминга, оценки устойчивости и контролируемых экспериментов. Вы принимаете на себя полную ответственность и все связанные с ней обязательства за то, как вы её используете, и за всё, что она генерирует, и вы не должны развёртывать её для конечных пользователей или в производственной среде, не добавив собственные слои безопасности, модерации и предотвращения злоупотреблений. Авторы не несут ответственности за неправомерное использование. Скачивая репозиторий, вы принимаете эти условия; лицензия — Apache 2.0.
В этой статье намеренно нет вредоносных промптов. Приведённые выше показатели отказов взяты из собственного набора оценки безопасности модели, указанного в её карточке, — а это и есть правильный способ измерять модель такого класса: запустить стандартные бенчмарки отказов, прочитать числа и выстроить своё исследование вокруг того, что они показывают.
Источники и дата
Все приведённые выше факты были проверены 16 августа 2026 года. Список файлов и их размеры взяты из репозитория Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (создан 16 августа 2026 г.; архитектура qwen35; лицензия Apache 2.0; ограниченный доступ). Показатели отказов и возможностей взяты из набора тестов оценки безопасности карточки модели. Измерение KV-кэша (~2 ГБ при контексте 32K) взято из руководства OrcaRouter для этой архитектуры, How to Run Qwen 3.8 27B Locally. Стоимость хостинга и условия доступа взяты со страницы модели obsidian/Qwen3.8-27B, проверено в тот же день. Размеры квантованных файлов указаны в десятичных ГБ, как они хранятся на Hugging Face.
Для легитимных исследований, веса доступны на Hugging Face: Скачать с Hugging Face — без кредитной карты, запуск за 60 секунд.
