Титульная карточка для статьи «Qwen 3.8 27B Uncensored GGUF»: закруглённая исследовательская карточка с заголовком «Qwen3.8-27B Uncensored GGUF», подзаголовком «Abliterated — локальная сборка для llama.cpp», чипами с надписями «12 УРОВНЕЙ КВАНТИЗАЦИИ», «КОНТЕКСТ 262K», «VISION + MTP» и значком щита с пометкой «ТОЛЬКО ДЛЯ ИССЛЕДОВАНИЙ». Логотип OrcaRouter размещён в правом нижнем углу.
Guides & Insights

Qwen 3.8 27B Uncensored GGUF: аблатерированная локальная сборка, 12 квантизаций и ограничение «только для исследований»

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Qwen 3.8 27B uncensored GGUF — это реальный файл для скачивания, и сборка, с которой стоит начать, — Qwen3.8-27B-Uncensored-GGUF — опубликована на Hugging Face 16 августа 2026 года как нативная для llama.cpp версия нашего abliterated-релиза FP8. Это те же лишённые отказов веса на 27 миллиардов параметров, что и Qwen3.8-27B-Uncensored-FP8, преобразованные в GGUF для локального инференса: F16 плюс 12 уровней квантизации от Q2_K до Q8_0 (включая imatrix-кванты IQ3_M и IQ4_XS), окно контекста 262K, отдельный vision-проектор и нетронутая MTP-голова для спекулятивного декодирования. «Uncensored» означает abliterated — направление отказа было ортогонализировано из весов — поэтому модель отвечает там, где выровненная базовая версия отказывается, и именно поэтому она только для исследовательских целей. Вот что на самом деле содержит репозиторий, какой квант подходит для вашего GPU, как запустить её в llama.cpp и какие границы безопасности вы принимаете при скачивании.

{{1}}Версия на 30 секунд:{{/1}} {{2}}F16 плюс 12 квантизаций, Q4_K_M на 16,8 ГБ — стандартный выбор,{{/2}} {{3}}вам нужна сборка llama.cpp от мая 2026 года или новее,{{/3}} {{4}}и это исследовательский инструмент без ограничений — не то, что стоит разворачивать для конечных пользователей.{{/4}}

Что на самом деле означает «uncensored GGUF» — и чем эта сборка отличается от версии FP8

GGUF — это однофайловый формат моделей, используемый llama.cpp; FP8 — это схема квантования, которая работает на GPU-серверах vLLM. Наши два выпуска без цензуры — это одни и те же abliterated-веса в двух рантаймах. Qwen3.8-27B-Uncensored-FP8 (15 августа 2026 года) нацелен на vLLM на сервере и повторно квантован по официальной схеме Qwen3.8-27B-FP8, чтобы работать на том же пути ядра. Qwen3.8-27B-Uncensored-GGUF (16 августа 2026 года) нацелен на llama.cpp на локальной машине — настольном GPU или рабочей станции, которой вы управляете. Те же веса, другая модель развёртывания: облачный API против локального процесса.

Abliteration — это вмешательство на уровне весов, а не дообучение. Направление отказа — вектор в остаточном потоке модели, который при активации выдаёт «Я не могу помочь с этим»; сборка находит это направление и ортогонализирует его из весов, следуя подходу Arditi и др., 2024 («Refusal in Language Models Is Mediated by a Single Direction»). Никакие новые веса не обучаются. Базовая модель — Qwen/Qwen3.8-27B: плотная модель на 27 млрд параметров с гибридной архитектурой (48 слоёв линейного внимания Gated DeltaNet и 16 слоёв полного внимания), нативной поддержкой изображений и контекстом на 262 144 токена. Лицензия — Apache 2.0, унаследованная от базовой модели. Обратите внимание: в официальном репозитории Qwen представлены только safetensors в формате BF16 — официального GGUF от Qwen не существует, — поэтому любой несензурированный GGUF этой модели, включая этот, является конвертацией открытых весов.

Квантовая лестница — F16 плюс 12 уровней

Репозиторий содержит F16 (54,6 ГБ в двух файлах) и 12 уровней квантования. Размеры ниже — это размеры файлов в самом репозитории по состоянию на 16 августа 2026 года; размеры GGUF-файлов незначительно отличаются от сборки к сборке.

Card titled 'Qwen3.8-27B Uncensored GGUF — the quant ladder' listing F16 54.6 GB and 12 quantization tiers with file sizes: Q8_0 29.0 GB near-lossless, Q6_K 22.4 GB, Q5_K_M 19.5 GB, Q5_K_S 19.0 GB, Q4_K_M 16.8 GB marked recommended default, Q4_K_S 15.8 GB, IQ4_XS 15.3 GB marked best low-bit pick, Q3_K_L 14.6 GB, Q3_K_M 13.5 GB, IQ3_M 12.8 GB, Q3_K_S 12.3 GB, Q2_K 10.9 GB, with a footer reading 'File sizes per the Hugging Face repo, read August 16 2026'.

F16 — 54.6 GB (2 файла) — эталонная точность

Q8_0 — 29.0 GB — почти без потерь, для высокопроизводительных GPU

Q6_K — 22,4 ГБ — оптимальное соотношение качества и размера

Q5_K_M — 19.5 ГБ / Q5_K_S — 19.0 ГБ — высокое качество на видеокартах с большим объёмом памяти

Q4_K_M — 16,8 ГБ — рекомендуемый вариант по умолчанию

Q4_K_S — 15.8 GB

IQ4_XS — 15.3 GB — лучший низкобитовый вариант (imatrix-калиброванный)

Q3_K_L — 14.6 ГБ / Q3_K_M — 13.5 ГБ — для видеокарт на 16 ГБ

IQ3_M — 12.8 ГБ — компактный размер (калибровка imatrix)

Q3_K_S — 12.3 GB

Q2_K — 10.9 GB — самый маленький K-квант, заметный компромисс по качеству

Рекомендации по оборудованию: {{1}}Q4_K_M{{/1}} на видеокарте 24 ГБ (RTX 4090 или RTX 3090); IQ4_XS или Q3_K_M — если у вас 16 ГБ; Q2_K — только если вы ограничены 12 ГБ. Поскольку базовая модель использует гибридное внимание Gated DeltaNet, KV-кэш небольшой — примерно 0,5 ГБ при контексте 8K — так что окно контекста можно поднять значительно выше, чем у обычной плотной модели на 27B. Визуальная часть добавляет один отдельный файл: F16-проектор весит 931 МБ. Для той же базовой модели также существует общественная серия с аблитерацией на 9 квантов; наша — это конвертация документированной аблитерации FP8, с сохранением imatrix-квантов и значений refusal-delta из карточки модели.

Как запустить это в llama.cpp

Три шага. Одно неочевидное требование: архитектура qwen35 и поддержка MTP появились в llama.cpp в мае 2026 года, поэтому обновитесь до сборки от 2026-05 или новее — старые сборки не загрузят эти файлы (согласно README репозитория).

1. Скачайте выбранный вами квант и визуальный проектор. Репозиторий имеет ограниченный доступ, поэтому сначала войдите в Hugging Face и примите условия — чтение README является частью принятия того, что это за модель.

huggingface-cli скачать orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc

2. Запустите llama-server. Он предоставляет OpenAI-совместимый endpoint; -ngl 99/ выгружает все слои на GPU.

llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080

3. (необязательно) включите головку спекулятивного декодирования MTP. Добавьте --spec-type draft-mtp/ — головка nextn встроена в каждую квантованную модель, поэтому отдельная драфт-модель не нужна.

Card titled 'Run it locally in llama.cpp' with steps: update to a llama.cpp build from May 2026 or newer for the qwen35 architecture and MTP; download via huggingface-cli including the Q4_K_M quant and mmproj-Qwen3.8-27B-Uncensored-f16.gguf; run llama-server with --mmproj, -ngl 99, -c 16384, --jinja; optional --spec-type draft-mtp for the embedded speculative-decoding head, with a footer reading 'OpenAI-compatible endpoint at http://localhost:8080/v1/chat/completions'.

При текстовых исследовательских запусках можно опустить --mmproj/; для ввода изображений он нужен, поскольку это нативная визуально-языковая модель. Эндпоинт: http://localhost:8080/v1/chat/completions, поэтому существующий код OpenAI SDK работает при замене базового URL.

Нет GPU? Та же нецензурированная линейка размещена онлайн

Локальный GGUF ничего не стоит за токен, но требует примерно 17 ГБ видеопамяти для уровня Q4_K_M. Если у вас нет такого железа, размещённая модель obsidian/Qwen3.8-27B на OrcaRouter предоставляет ту же линейку 27B без цензуры — зрение, рассуждения, контекст 262K — по цене $0.40 за миллион входных токенов и $4.21 за миллион выходных, с доступом, ограниченным для исследователей безопасности, red teams и исследователей безопасности ИИ. То же семейство весов, два рантайма: GGUF локально, FP8 в облаке. Решение о модерации в любом случае остаётся на вашей стороне.

Граница безопасности — прочтите это перед загрузкой

У этой модели в значительной степени удалено выравнивание безопасности. Она будет выполнять вредные, неэтичные, оскорбительные или незаконные запросы, от которых отказалась бы базовая модель Qwen3.8-27B, и у неё нет значимых встроенных ограничителей. Она выпущена строго для легитимных исследований — интерпретируемости, изучения механизмов отказа, red-teaming, оценки робастности и тестирования ограничителей. Вы полностью отвечаете за то, как вы её используете, и за всё, что она генерирует; вы не должны развёртывать её для конечных пользователей или в производство без добавления собственных уровней безопасности, модерации и предотвращения злоупотреблений. Авторы не несут ответственности. Лицензия — Apache 2.0.

A safety-boundary card with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production apps and consumer services, with a warning strip reading 'No built-in guardrails — the model will comply with requests the base model refuses' and a footer reading 'Apache 2.0 · research-only · you assume full responsibility and liability'.

Измеренное поведение показывает, чего стоит «бесцензурность». Набор оценок безопасности из карточки модели — проведённый на сборке FP8 и датированный 15 августа 2026 года, то есть для тех весов, которые конвертирует данный GGUF, — демонстрирует: отказ от вредоносных промптов падает с 64–99% на базовой модели до 0–6% на аблятированных весах, избыточный отказ на безобидные запросы снижается с 5,6% до 0,4%, а показатели способностей остаются в пределах ±1,3 пункта от базовых. Эти цифры — причина, по которой такой класс моделей является законным объектом исследования, — и в то же время предупреждение.

Эта статья намеренно не содержит вредоносных промптов. Если вы оцениваете модель, запустите стандартные бенчмарки отказа — AdvBench, HarmBench, StrongREJECT, XSTest-safe — и сами прочитайте цифры. Это санкционированный способ изучения модели с удалённым отказом.

Когда эта сборка — неверный ответ

1. Вам нужен обычный ассистент. Неправильная модель. У неё нет защитных механизмов, и она будет выполнять вредоносные запросы. Вместо неё используйте выровненную модель Qwen3.8-27B.

2. Всё, что вы поставите перед конечными пользователями. Неправильная модель, независимо от намерений. Apache 2.0 не освобождает вас от ответственности, а выпуск модели без защитных механизмов для пользователей — это не стратегия развертывания.

3. У вас Apple Silicon. GGUF будет работать, но конвертация базовой модели в MLX — более естественный вариант: смотрите наше отдельное руководство по MLX.

4. Вы вообще не хотите запускать его. Используйте размещенную карту — те же веса, без 17 ГБ видеопамяти и тот же доступ только для исследований.

Суть

«Qwen 3.8 27B uncensored GGUF» имеет ответ, и это конкретная загрузка: Qwen3.8-27B-Uncensored-GGUF — F16 плюс 12 уровней квантования для llama.cpp, аблатированные веса из нашей FP8-сборки, контекст 262K, зрение и MTP, под лицензией Apache 2.0 и только для исследовательских целей. Для видеокарты с 24 ГБ выбирайте Q4_K_M, обновите llama.cpp до версии после мая 2026 года и запустите его как локальный сервер, совместимый с OpenAI. Это исследовательский инструмент для изучения отказов и тестирования защитных механизмов — не чат-бот и не то, что следует выпускать в продакшн. Веса бесплатны; ответственность за то, что вы с ними делаете, полностью лежит на вас.

Для легитимных исследований F16 и все 12 уровней квантования доступны на Hugging Face: Скачайте GGUF с Hugging Face

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube