
Qwen 3.8 27B Uncensored GGUF:Abliterated ローカルビルド、12 クアント、そして研究専用の境界
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 42 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Qwen 3.8 27B uncensored GGUF は実際にダウンロードできるもので、まず始めるべきビルドは Qwen3.8-27B-Uncensored-GGUF です — 2026年8月16日に Hugging Face で公開された、私たちの abliterated FP8 リリースの llama.cpp ネイティブな兄弟版です。これは Qwen3.8-27B-Uncensored-FP8 と同じ拒否除去済みの270億パラメータの重みを、ローカル推論用に GGUF へ変換したものです。F16 に加えて Q2_K から Q8_0 までの12段階の量子化ティア(imatrix 量子化の IQ3_M と IQ4_XS を含む)、262K のコンテキストウィンドウ、独立した vision projector、そして MTP 投機的デコーディングヘッドがそのまま維持されています。「Uncensored」は abliterated を意味します — 拒否方向が重みから直交化によって除去されている — そのため、アラインメント済みのベースモデルが拒否する場面でも回答し、まさにそれが研究専用である理由です。以下では、リポジトリに実際に含まれているもの、どの量子化があなたの GPU に適合するか、llama.cpp で実行する方法、そしてダウンロードによって受け入れることになる安全上の境界について説明します。
30秒版:F16と12個の量子化、16.8 GBのQ4_K_Mが既定の選択肢で、llama.cppは2026年5月以降のビルドが必要です。これはガードレールのない研究用ツールであり、エンドユーザーにデプロイするようなものではありません。
「uncensored GGUF」が実際に意味するもの — そして、このビルドがFP8版とどう異なるのか
GGUFはllama.cppが使用する単一ファイル形式のモデルフォーマットであり、FP8はvLLMのGPUサーバー上で動作する量子化スキームです。当社の2つの無検閲リリースは、同じabliterated重みを2つのランタイムで動かすものです。Qwen3.8-27B-Uncensored-FP8(2026年8月15日)はサーバー上のvLLMを対象とし、公式のQwen3.8-27B-FP8スキームへ再量子化されているため、同一のカーネルパスで配信されます。Qwen3.8-27B-Uncensored-GGUF(2026年8月16日)はローカルマシン——あなたが管理するデスクトップGPUまたはワークステーション——上のllama.cppを対象としています。同じ重み、異なるデプロイモデル:クラウドAPIかローカルプロセスか。
Abliteration はファインチューニングではなく、単語レベルの介入である。拒否方向とは、モデルの残差ストリーム内のベクトルであり、活性化されると「それはお手伝いできません」を出力させる。このビルドはその方向を見つけ出し、Arditi et al. 2024 のアプローチ(「Refusal in Language Models Is Mediated by a Single Direction」)に従って、それを重みから直交化して排除する。新しい重みは学習されない。ベースは Qwen/Qwen3.8-27B で、ハイブリッドアーキテクチャ(48 の Gated DeltaNet 層と 16 のフルアテンション層)、ネイティブの視覚機能、262,144 トークンのコンテキストを備えた密な 27B モデルである。ライセンスはベースから継承された Apache 2.0 です。Qwen の公式リポジトリは BF16 safetensors のみを配布しており、公式の Qwen GGUF は存在しないため、このモデルの無検閲 GGUF は、これを含め、オープン重みを変換したものであることに注意。
量子化ラダー — F16と12段階
このリポジトリは F16(2ファイルで合計54.6 GB)と12段階の量子化ティアを提供しています。以下に示すサイズは、このリポジトリ自身のファイルサイズで、2026年8月16日に取得したものです。GGUFファイルのサイズはビルドごとに多少異なります。

• F16 — 54.6 GB(2ファイル) — 基準精度
• Q8_0 — 29.0 GB — ほぼロスレス、ハイエンドGPU向け
• Q6_K — 22.4 GB — ギガバイトあたりの品質のスイートスポット
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — 大容量カードで高品質
• Q4_K_M — 16.8 GB — 推奨されるデフォルト
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — 低ビットの中で最良の選択(imatrixキャリブレーション済み)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — 16 GB カード向け
• IQ3_M — 12.8 GB — 小さいフットプリント(imatrixキャリブレーション済み)
• Q3_K_S — 12.3 GB
• Q2_K — 10.9 GB — 最小のK量子化、目に見える品質の妥協
ハードウェアの目安:24 GBカード(RTX 4090またはRTX 3090)ならQ4_K_M、16 GBならIQ4_XSまたはQ3_K_M、12 GBまで切り詰められている場合のみQ2_K。ベースはハイブリッドGated DeltaNet attentionを採用しているため、KVキャッシュは小さく、8Kコンテキストでおよそ0.5 GBです。そのため、従来の27B denseモデルよりもはるかに大きいウィンドウまで押し上げられます。Visionは別ファイルを1つ追加します。F16 projectorは931 MBです。同じベース向けの9-quantコミュニティabliteratedシリーズも存在します。私たちのものは、文書化されたFP8 abliterationを変換したもので、imatrix量子化とモデルカードのrefusal-delta数値も引き継いでいます。
それを llama.cpp で実行する方法
3つのステップ。1つだけ気づきにくい要件があります。qwen35アーキテクチャとMTPサポートは2026年5月にllama.cppへ追加されたため、2026-05以降のビルドに更新してください — 古いビルドではこれらのファイルを読み込めません(リポジトリのREADMEによる)。
1. 選んだ量子化モデルとビジョンプロジェクターをダウンロードします。 このリポジトリはゲート制限されているので、まず Hugging Face にログインして条件に同意してください — README を読むことも、このモデルが何であるかを受け入れることの一部です。
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. llama-server を起動します。 これは OpenAI 互換のエンドポイントを提供します;-ngl 99/ はすべてのレイヤーを GPU にオフロードします。
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3.(オプション)MTP投機的デコーディングヘッドを有効にします。 を追加します。--spec-type draft-mtp/ — nextnヘッドはすべての量子化に埋め込まれているため、別途ドラフトモデルは不要です。

テキストのみの研究実行では--mmprojを省略できます。画像入力にはこれが必要です。これはネイティブの視覚言語モデルだからです。エンドポイントは http://localhost:8080/v1/chat/completions なので、既存の OpenAI SDK コードはベース URL を差し替えるだけでそのまま動作します。
GPUがない?同じ無検閲のラインがホストされています
ローカルのGGUFはトークンあたりの費用がかからないが、Q4_K_Mティアでは約17 GBのVRAMが必要です。ハードウェアを持っていない場合、OrcaRouter上のホスト済みカード obsidian/Qwen3.8-27B が、同じ無検閲の27Bモデルライン——ビジョン、推論、262Kコンテキスト——を提供します。料金は入力100万トークンあたり$0.40、出力100万トークンあたり$4.21で、アクセスはセキュリティ研究者、レッドチーム、AI安全性研究者に限定されています。同じ重みファミリー、2つのランタイム:ローカルではGGUF、クラウドではFP8。どちらの場合でも、モデレーションの判断はあなたの側に残ります。
安全境界 — ダウンロードする前にこれを読んでください
このモデルは安全性アラインメントが大幅に除去されています。ベースのQwen3.8-27Bなら拒否するような有害、非倫理的、攻撃的、または違法な要求にも従い、意味のある組み込みのガードレールを備えていません。これは厳密に正当な研究目的—解釈可能性、拒否メカニズムの研究、レッドチーミング、堅牢性評価、ガードレールテスト—のために公開されています。あなたはその使用方法と生成されるすべてのものに対して全責任と法的責任を負い、独自の安全性、モデレーション、悪用防止の層を追加せずにエンドユーザーや本番環境にデプロイしてはなりません。著者は一切の責任を負いません。ライセンスはApache 2.0です。

測定された挙動は、「検閲なし」が何を犠牲にするかを示している。モデルカードの安全性評価スイートから — FP8ビルドで実行され、2026年8月15日付、これはこのGGUFが変換する重みである:有害プロンプトの拒否率はベースの64~99%からabliterated重みの0~6%へ低下し、無害な過剰拒否は5.6%から0.4%へ下がり、能力スコアはベースの±1.3ポイント以内にとどまる。これらの数値こそ、このクラスのモデルが正当な研究対象である理由であり、同時に警告でもある。
この記事には、有害なプロンプトが意図的に一切含まれていません。モデルを評価しているのであれば、標準的な拒否ベンチマーク — AdvBench、HarmBench、StrongREJECT、XSTest-safe — を実行し、数値を自分で確認してください。それが、拒否機能を除去したモデルを研究するための認められた方法です。
このビルドが間違った答えである場合
1. 普通のアシスタントが欲しい。モデルが間違っています。ガードレールがなく、有害なリクエストにも応じてしまいます。代わりにアラインメント済みのQwen3.8-27Bを使用してください。
2. エンドユーザーの前に出すものすべて。 意図がどうであれ、誤ったモデルです。Apache 2.0 はあなたの責任を移転するものではなく、ガードレールのないモデルをユーザーに出荷することはデプロイ戦略ではありません。
3. Apple Silicon をお使いの場合。 GGUF も動作しますが、ベースモデルの MLX 変換の方がより自然な選択です — 別途ご用意している MLX ガイドをご覧ください。
4. そもそもまったく実行したくない場合。 ホスト版のカードを使いましょう — 同じ重み、17 GB の VRAM は不要、そして同じ研究専用のゲートです。
結論
「Qwen 3.8 27B uncensored GGUF」には答えがあり、それは具体的なダウンロードだ。Qwen3.8-27B-Uncensored-GGUF — llama.cpp用のF16から各種量子化ティア、当社のFP8ビルドから得たabliterated重み、262K、ビジョン、MTPを備え、Apache 2.0かつ研究用途限定。24 GBのカードならQ4_K_Mを選び、llama.cppを2026年5月より後に更新して、ローカルのOpenAI互換サーバーとして動かせ。これは拒否を研究し、ガードレールをテストするための研究用ツールであり、チャットボットではなく、出荷するようなものでもない。重みは無料だが、それをどう使うかの責任は完全にあなたにある。
正当な研究目的であれば、F16および12段階すべての量子化ティアはHugging Faceにあります:Hugging FaceからGGUFをダウンロード
