
Qwen 3.8 27B Uncensored GGUF:アブリテイトされたローカルビルド、12量子化、そして研究専用の境界
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-1552知能68コーディング
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-1358 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaNEWMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
- grokxAI: Grok 4.52026-07-0856知能72コーディング
- tencentTencent: Hy32026-07-0642知能59コーディング
Qwen 3.8 27B uncensored GGUFは実際にダウンロード可能で、最初に使うべきビルドはQwen3.8-27B-Uncensored-GGUFです。2026年8月16日にHugging Faceで公開された、当社のabliterated FP8リリースのllama.cppネイティブ版です。これは、Qwen3.8-27B-Uncensored-FP8と同じ、拒否応答を除去した270億パラメータの重みを、ローカル推論用にGGUF形式へ変換したものです。F16に加えて、Q2_KからQ8_0までの12段階の量子化(imatrix量子化のIQ3_MとIQ4_XSを含む)、262Kのコンテキストウィンドウ、専用のビジョンプロジェクター、MTP投機的デコードヘッドをそのまま備えています。「Uncensored」はabliteratedを意味します。つまり、拒否の方向性が重みから直交化されて除去されているため、アライメントされたベースモデルが拒否する箇所でも応答します。まさにそのため、研究目的専用です。このリポジトリに実際に含まれるもの、どの量子化があなたのGPUに適合するか、llama.cppでの実行方法、そしてダウンロードすることで受け入れる安全性の境界について、以下で説明します。
「30秒版:F16と12種類の量子化版を含み、16.8GBのQ4_K_Mがデフォルトの選択肢です。llama.cppは2026年5月以降のビルドが必要です。これはガードレールのない研究用ツールであり、エンドユーザーにデプロイするためのものではありません。」
「検閲なしGGUF」の実際の意味 — そしてこのビルドがFP8版とどう違うのか
GGUFはllama.cppが使用する単一ファイルモデル形式で、FP8はvLLM GPUサーバー上で動作する量子化方式です。当社の2つのアンセンサードリリースは、同じアブリテレーション済みウェイトを2つのランタイムで提供したものです。Qwen3.8-27B-Uncensored-FP8(2026年8月15日)は、サーバー上のvLLMを対象としており、公式のQwen3.8-27B-FP8スキームに再量子化されているため、同一のカーネルパスでサービスを提供します。Qwen3.8-27B-Uncensored-GGUF(2026年8月16日)は、ローカルマシン(ユーザーが管理するデスクトップGPUまたはワークステーション)上のllama.cppを対象としています。同じウェイトでも、デプロイメントモデルが異なります。クラウドAPIとローカルプロセスです。
Abliterationは重みレベルの介入であり、ファインチューニングではありません。拒否方向はモデルの残差ストリーム内のベクトルであり、活性化されると「それにはお手伝いできません」を生成します。このビルドはその方向を見つけ出し、Arditiら2024(「Refusal in Language Models Is Mediated by a Single Direction」)の手法に従って、重みからその方向を直交化します。新しい重みは訓練されません。ベースはQwen/Qwen3.8-27Bです。これは、ハイブリッドアーキテクチャ(48のGated DeltaNet線形アテンション層と16のフルアテンション層)を備えた高密度27Bモデルで、ネイティブの視覚機能と262,144トークンのコンテキストを備えています。ライセンスはApache 2.0で、ベースから継承されています。なお、Qwenの公式リポジトリはBF16 safetensorsのみを提供しており、公式のQwen GGUFは存在しないため、このモデルの検閲なしGGUF(これを含む)はすべて、オープンウェイトの変換版です。
クオンツラダー — F16プラス12ティア
このリポジトリには、F16(2ファイル合計54.6 GB)と12種類の量子化レベルが含まれています。以下のサイズは2026年8月16日時点のリポジトリのファイルサイズであり、GGUFファイルのサイズはビルドごとにわずかに異なる場合があります。

• F16 — 54.6 GB(2ファイル) — リファレンス精度
• Q8_0 — 29.0 GB — ほぼロスレス、ハイエンドGPU向け
• Q6_K — 22.4 GB — GBあたりの品質が最適なバランス
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — 大容量カード向けの高品質
• Q4_K_M — 16.8 GB — 推奨されるデフォルト
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — 最良の低ビット選択肢(imatrixキャリブレーション済み)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — 16 GBカード用
• IQ3_M — 12.8 GB — 軽量 (imatrix較正済み)
• Q3_K_S — 12.3 GB
• Q2_K — 10.9 GB — 最小のK-quantで、品質の低下が目立つ
ハードウェアの目安:24GBカード(RTX 4090またはRTX 3090)ではQ4_K_M。16GBならIQ4_XSまたはQ3_K_M。12GBまで絞られる場合のみQ2_K。ベースはハイブリッドGated DeltaNetアテンションを使用しているため、KVキャッシュは小さく、8Kコンテキストでおよそ0.5GBです。したがって、従来の27B Denseモデルよりもはるかに高いウィンドウまで拡張できます。ビジョンには別のファイルが1つ追加されます:F16プロジェクターは931MBです。同じベース向けに、9量子化のコミュニティ製アブリテレーション(abliterated)シリーズも存在します。当方は、文書化されたFP8アブリテレーションの変換版であり、imatrix量子化とモデルカードのrefusal-delta数値を引き継いでいます。
llama.cppでそれを実行する方法
3つのステップ。1つ、わかりにくい要件があります:qwen35アーキテクチャとMTPサポートは2026年5月にllama.cppに搭載されたため、2026-05以降のビルドに更新してください — 古いビルドではこれらのファイルを読み込めません(リポジトリのREADMEによる)。
1. 選択した量子化モデルとビジョンプロジェクターをダウンロードしてください。 リポジトリは制限されているため、まずHugging Faceにログインして条件に同意する必要があります — READMEを読むことは、このモデルが何であるかを受け入れることの一部です。
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. llama-serverを起動します。これはOpenAI互換のエンドポイントを提供します。-ngl 99/すべてのレイヤーをGPUにオフロードします。
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3.(任意)MTP投機的デコードヘッドを有効にします。追加:--spec-type draft-mtp/ — nextnヘッドはすべての量子化モデルに組み込まれているため、別途ドラフトモデルは不要です。

テキストのみのリサーチ実行では --mmproj/ を省略できます。画像入力にはそれが必要です。これはネイティブの視覚言語モデルだからです。エンドポイントは http://localhost:8080/v1/chat/completions なので、既存のOpenAI SDKを使ったコードはベースURLを差し替えるだけで動作します。
GPUがない?同じ無検閲版がホストされています。
ローカルGGUFはトークンあたりのコストはかかりませんが、Q4_K_Mティアでは約17GBのVRAMが必要です。そのハードウェアをお持ちでない場合、OrcaRouter上のホスト型カードobsidian/Qwen3.8-27Bが、同じ無検閲の27B系——ビジョン、推論、262Kコンテキスト——を、入力トークン100万あたり0.40ドル、出力トークン100万あたり4.21ドルで提供します。アクセスはセキュリティ研究者、レッドチーム、AI安全性研究者に限定されています。同じ重みのファミリーでありながら、2つのランタイムがあります:ローカルではGGUF、クラウドではFP8です。モデレーションの判断は、どちらの場合もお客様側に委ねられます。
安全の境界線 — ダウンロードする前に必ずお読みください
このモデルは、安全性のアライメントが大幅に除去されています。ベースモデルであるQwen3.8-27Bなら拒否するような、有害、非倫理的、攻撃的、または違法なリクエストにも応じる可能性があり、実質的な組み込みのガードレールはありません。このモデルは、解釈可能性、拒否メカニズムの研究、レッドチーミング、堅牢性評価、ガードレールのテストといった正当な研究目的にのみ公開されています。利用者は、その使用方法と生成されるすべての内容について全責任と法的責任を負うものとし、独自の安全性、モデレーション、悪用防止の各レイヤーを追加せずにエンドユーザーへ展開したり、本番環境に導入したりしてはなりません。著者は一切の責任を負いません。ライセンスはApache 2.0です。

測定された挙動は、{{1}}「検閲なし」の代償{{/1}}を教えてくれる。モデルカードの安全性評価スイート(このGGUFが変換する重みであるFP8ビルドで実行され、2026年8月15日付のもの)によれば、有害プロンプトへの拒否率はベースの64〜99%からアブリタレーション処理後の重みでは0〜6%に低下し、良性の過剰拒否は5.6%から0.4%に減少、性能スコアはベースに対して±1.3ポイント以内に収まっている。{{2}}これらの数値こそが、このクラスのモデルが正当な研究対象である理由であり——同時に警告でもある。{{/2}}
この記事には意図的に有害なプロンプトは含まれていません。モデルを評価する場合は、標準的な拒否応答ベンチマーク — AdvBench、HarmBench、StrongREJECT、XSTest-safe — を実行し、数値をご自身で確認してください。それが拒否応答が除去されたモデルを研究するための正式な方法です。
このビルドが間違った答えである場合
1. あなたは通常のアシスタントを求めています。モデルが間違っています。それにはガードレールがなく、有害なリクエストに応じてしまいます。代わりに整合済みのQwen3.8-27Bを使用してください。
2. エンドユーザーの前に出すものなら何でも。 意図が何であれ、間違ったモデル。Apache 2.0はあなたの責任を移転するものではなく、ガードレールなしのモデルをユーザーに提供することはデプロイ戦略ではない。
3. Apple Silicon搭載のMacをお使いの場合。GGUFでも動作しますが、ベースモデルのMLX変換版の方がより適しています。詳細は別のMLXガイドをご覧ください。
4. そもそも実行したくない場合です。ホスト型カードを使用してください — 同じ重み、17 GBのVRAM不要、同じ研究専用ゲートです。
結論
"Qwen 3.8 27B uncensored GGUF" には答えがあり、それは具体的なダウンロードです: Qwen3.8-27B-Uncensored-GGUF — F16 に加えて llama.cpp 用の12の量子化ティア、私たちの FP8 ビルドからの abliterated 重み、262K コンテキスト、ビジョン、MTP、Apache 2.0 および研究専用。24 GB のカードでは Q4_K_M を選び、llama.cpp を 2026年5月以降に更新し、ローカルの OpenAI 互換サーバーとして実行してください。これは拒否を研究し、ガードレールをテストするための研究ツールです — チャットボットでも、製品として出荷するものでもありません。重みは無料です。それを使って何をするかの責任はすべてあなたにあります。
正当な研究目的であれば、F16と全12の量子化ティアはHugging Face上にあります:Hugging FaceからGGUFをダウンロード
