Редакционная flat-векторная иллюстрация для hero-изображения технологического блога о запуске нецензурированной, аблятированной большой языковой модели локально на собственном оборудовании: крупный округлый чип модели тёмно-синего цвета с мягким циановым свечением парит слева от центра; его внутренняя схема растворяется, переходя из формы закрытого замка в открытый. Справа от него — компактная видеокарта на верстаке и тонкое окно терминала с абстрактными горизонтальными командными строками и маленьким силуэтом ламы рядом. В верхнем углу — небольшая иконка микроскопа и закруглённый щит с предупреждающим треугольником, намекающие на исследовательское применение и границы безопасности. Мягкий светло-голубой и белый фон, обильное пустое пространство в нижней трети. Без читаемого текста.
Guides & Insights

Как запустить Qwen3.8-27B-Uncensored локально: GGUF Quants, llama.cpp и Ollama

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Чтобы запустить Qwen3.8-27B-Uncensored локально, загрузите gated-репозиторий GGUF orcarouter/Qwen3.8-27B-Uncensored-GGUF с Hugging Face, выберите квант по объёму вашей VRAM — Q4_K_M (16,8 ГБ) для GPU на 24 ГБ, IQ4_XS (15,3 ГБ) для GPU на 16 ГБ, Q3_K_M (13,5 ГБ), если нужен запас по контексту — и запустите его с актуальной сборкой llama.cpp, используя флаг --jinja, добавив --mmproj, если требуется поддержка зрения. Тот же файл импортируется в Ollama тремя командами. Это GGUF-версия abliterated-сборки Qwen3.8 27B, выпущенной 16 августа 2026 года, с сохранёнными в каждом кванте нативным контекстом на 262K, визуальным проектором и MTP-головой спекулятивного декодирования. Это исследовательский инструмент, а не ассистент: у него удалено поведение отказа, в нём нет встроенных защитных механизмов, а лицензия — Apache 2.0. Прежде чем скачивать, прочитайте предупреждение о безопасности внизу этой страницы — в этом и заключается смысл gated-репозитория.

Какой GGUF скачать, в зависимости от VRAM

Репозиторий содержит одну пару файлов полной точности и двенадцать квантованных файлов, так что решение о загрузке на самом деле зависит от объёма видеопамяти. Приведённые ниже числа — это размеры файлов, полученные из репозитория Hugging Face 2026-08-16.

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

Что на самом деле в репозитории

Репозиторий orcarouter/Qwen3.8-27B-Uncensored-GGUF содержит пятнадцать файлов модели: веса F16, разбитые на две части, двенадцать квантованных GGUF — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M и IQ4_XS — а также визуальный проектор mmproj. Это GGUF-экспорт той же abliterated-сборки, что и Qwen3.8-27B-Uncensored-FP8, переупакованный для локальных сред выполнения класса llama.cpp. Он наследует лицензию Apache 2.0 базовой модели и её родной контекст в 262 144 токена.

Три свойства сохраняются во всех квантах. Архитектура — qwen35 — гибридное внимание с 48 линейными слоями Gated DeltaNet и 16 слоями полного внимания; именно поэтому репозиторий отказывается загружаться в старых сборках llama.cpp, а KV-кэш остаётся небольшим. MTP (nextn) — голова спекулятивного декодирования сохраняется во всех квантах, как в K-quant, так и в IQ. А чат-шаблон — это Qwen Jinja, который нужно явно включить (см. ниже), иначе многоходовые диалоги сломаются.

Почему KV-кэш остаётся достаточно малым, чтобы иметь значение

Именно эта деталь делает локальный сценарий работающим. Из 64 слоёв только 16 используют полное внимание; остальные 48 используют линейное внимание Gated DeltaNet, которое не хранит обычный KV-кэш. Практический эффект, измеренный по оригинальному ранбуку этой архитектуры, — это KV-кэш примерно 2 ГБ при контексте 32K — около четверти того, что потребовалось бы обычной модели 27B. Вот почему файл Q4_K_M на 16,8 ГБ всё ещё помещается в видеокарту на 24 ГБ с длинным контекстным окном, и почему линейка несенсоренных GGUF-моделей работает на оборудовании, которое вообще не могло вместить чекпоинт BF16 на 55,6 ГБ.

Запустите это с помощью llama.cpp

llama.cpp — это предполагаемый путь. Вам нужна текущая сборка: основная ветка регистрирует архитектуру qwen35, а старые сборки полностью отказываются принимать файл. Форма команды, согласно примечаниям по использованию из карточки модели и руководству для этой архитектуры, такова:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

Это дает вам совместимый с OpenAI эндпоинт на localhost:8080. Для ввода изображений добавьте --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Замените Q4_K_M на квант, соответствующий вашей VRAM; флаги идентичны.

Запустите это с помощью Ollama

Ollama запускает тот же файл, импортируя его из Modelfile — это поддерживаемый способ добавить GGUF, которого нет в библиотеке. В каталоге, содержащем загруженный вами квант:

ИЗ ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

Сохраните эту строку как Modelfile, затем ollama create qwen3.8-27b-uncensored -f Modelfile и ollama run qwen3.8-27b-uncensored. Для vision добавьте строку mmproj в Modelfile (FROM ... Q4_K_M.gguf плюс путь к mmproj), и Ollama подключит проектор. Те же предостережения касаются --ctx и шаблона: установите размер контекста, который вы реально можете вместить, и помните, что модель с удалённым отказом отвечает без предохранительных барьеров между вами и выводом.

Что на самом деле изменило удаление отказа

В карточке модели публикуется набор тестов оценки безопасности для этой сборки. С отключённым мышлением доля отказов на стандартных бенчмарках с вредоносными запросами снижается с 64–99% на базовой модели до 0–6% на весах abliterated; с включённым мышлением отказы практически отсутствуют — 1,7% или меньше. Показатели способностей остаются в пределах ±1,3 пункта от базовой модели. Такова форма каждого релиза abliterated в этой линейке: отказы удалены, способности сохранены, и имеется оговорка: заметная часть ответов по-прежнему начинается с короткого дисклеймера — это артефакт обучения, а не отказ.

Обратная сторона — в этом и заключается весь смысл границы безопасности, описанной ниже: модель, которая никогда не отказывает, — это не лучший помощник, а объект иного рода. Это испытательный инструмент для измерения механизмов отказа и выяснения того, работает ли ваш собственный защитный барьер.

Что на самом деле с этим делать в исследовании

Три легитимных проекта, которые представляют собой санкционированное использование модели с удалённым отказом:

Когда эта сборка — неверный ответ

Если вам нужен обычный ассистент или что-то, что вы поставите перед конечными пользователями, это неправильная модель — в ней нет значимых встроенных ограничений, она будет выполнять запросы, которые базовая модель отклоняет, и Apache 2.0 не снимает с вас ответственность. Используйте для этого исходную выровненную модель Qwen3.8-27B. Если вы хотите обходить отказы в чат-боте, набор системных промптов даёт больше с меньшим риском, чем правка весов. А если у вас вообще нет GPU, но вы всё же хотите изучить модель, размещённая карточка obsidian/Qwen3.8-27B на OrcaRouter предоставляет ту же линию без цензуры по $0.40 за миллион входных токенов и $4.21 за миллион выходных, с тем же контекстом 262K; она ограничена для исследователей безопасности и ИИ-безопасности так же, как и репозиторий, и решение о модерации остаётся на вашей стороне. Эта карточка модели содержит информацию о ценах и бенчмарках.

Граница безопасности — прочтите это перед загрузкой

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

У этой модели существенно удалена защитная настройка безопасности (safety alignment). Она будет выполнять вредные, неэтичные, оскорбительные или незаконные запросы, которые оригинальная Qwen3.8-27B отказалась бы выполнять, и у неё нет значимых встроенных предохранителей. Она выпущена строго для легитимных исследований — изучения интерпретируемости, безопасности ИИ и механизмов отказов, red-teaming, оценки устойчивости и контролируемых экспериментов. Вы берёте на себя полную ответственность и обязательства за то, как вы её используете, и за всё, что она генерирует, и вы не должны развёртывать её для конечных пользователей или в производственной среде без добавления собственных уровней безопасности, модерации и предотвращения злоупотреблений. Авторы не несут ответственности за неправильное использование. Загрузка репозитория означает ваше согласие с этими условиями; лицензия — Apache 2.0.

Эта статья намеренно не содержит вредоносных промптов. Приведённые выше показатели отказов взяты из собственного набора средств оценки безопасности модели, указанного в её карточке (model card), — это правильный способ измерения модели данного класса: запустите стандартные бенчмарки отказов, изучите показатели и спроектируйте исследование на основе того, что они демонстрируют.

Источники и дата

Все приведённые выше факты были проверены 16 августа 2026 года. Список файлов и их размеры взяты из репозитория Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (создан 16 августа 2026 г.; архитектура qwen35; лицензия Apache 2.0; ограниченный доступ). Показатели отказов и возможностей взяты из набора тестов оценки безопасности карточки модели. Измерение KV-кэша (~2 ГБ при контексте 32K) взято из руководства OrcaRouter для этой архитектуры, How to Run Qwen 3.8 27B Locally. Стоимость хостинга и условия доступа взяты со страницы модели obsidian/Qwen3.8-27B, проверено в тот же день. Размеры квантованных файлов указаны в десятичных ГБ, как они хранятся на Hugging Face.

Для легитимных исследований, веса доступны на Hugging Face: Скачать с Hugging Face — без кредитной карты, запуск за 60 секунд.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube