Qwen3.8-27B GGUFと書かれたヒーロータイトルカード。サブタイトルは「あなたのGPUに最適な量子化」、ダウンロードアイコン、およびQ4_K_M 17.1GBとUD-IQ2 9.0GBのファイルチップが表示されています。
Guides & Insights

Qwen3.8-27B GGUF: あなたのGPUにダウンロードすべき量子化(Quant)は?

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

unsloth/Qwen3.8-27B-GGUFパックをダウンロードし、実際にお持ちのカードに合うファイルを選んでください。それが答えのすべてです。24GB GPU(RTX 4090または3090)は、次を選ぶべきです:17.1GBのQ4_K_M;16GB GPUは、次を選ぶべきです:15.7GBのIQ4_XS(または、コンテキストの余裕を重視するなら13.8GBのQ3_K_Mも選択肢です)。12GB GPUは2ビットファイルに制限され、9.0GBのUD-IQ2_XXS、これは承知の上での妥協です。Qwen3.8 27Bは、Ali​babaの高密度270億パラメータモデル(Apache 2.0、2026年8月13〜14日公開)であり、ハイブリッド注意機構が64層中16層のみをキャッシュするため、ローカルでの実行が驚くほど低コストです。そのため、24GB GPUでの4ビット量子化は、32K〜64Kトークンのコンテキストを余裕を持って保持できます。そしてGGUFは、追加コストがゼロの唯一の方法です。APIキーも不要、トークンごとの課金もなく、データがあなたのマシンの外に出ることもありません。

情報源について:アーキテクチャ、コンテキストウィンドウ、ライセンスは公式のものであり、Hugging Face 上の Qwen3.8 27B モデルカードから取得、2026年8月15日に確認済みです。GGUF サイズは unsloth と ggml-org の GGUF リポジトリから同日に取得したものです。GPU あたりの VRAM 目安は unsloth の公式推奨値です。KV キャッシュのバイト数推定値とトークン/秒の数値は、リリース直後にコミュニティが測定したものであり、ベンダー仕様ではありません。以下に挙げるベンチマークはすべて Ali​baba が報告したものであり、第三者による再現はされていません。

ファイルピッカー、quantごとに1行

UD-IQ2_XXS — 9.0GB — 12GBカードに快適に収まる唯一の選択肢。目に見える画質劣化が予想されます。

UD-Q2_K_XL — 10.7GB — 12GBカード、コンテキストにほとんど余裕がない。

Q3_K_M — 13.8GB — コンテキスト用の余裕が欲しい16GBカード向け。

IQ4_XS — 15.7GB — 16GBカード:全体が収まる最大の量子化モデル。

Q4_K_M — 17.1GB — 24GBカードにぴったりのサイズであり、この記事が推奨するファイルです。

Q5_K_M — 19.8GB — 24GB、わずかな品質向上と引き換えにコンテキストの余裕を削る。

Q6_K — 22.9GB — 絞れば24GBに収まる;ほぼロスレス。

Q8_0 — 29.0GB — 32GB、2枚のカードへの分割、またはCPUオフロード。

BF16 — 54.7GB — サーバーカードや大容量RAMを搭載したCPU構成向け。リファレンス精度。

2つのパック、2つのQ4_K_Mサイズ:unsloth版は17.1GB、ggml-org版は19.0GB。{{1}}unslothパックはUD-*ファイルにDynamic V3.0(プレビュー)量子化を使用しており、ほとんどのローカルアプリがデフォルトで使用するものです{{/1}};{{2}}ggml-orgパックは標準のK-quantsに加えて、投機的デコードに使用される別個のマルチトークン予測ヘッドを同梱しています{{/2}}。{{3}}どちらのQ4_K_Mでも動作します—違いは数百メガバイトとMTPファイルだけです{{/3}}。

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

なぜこの27Bは、ほとんどのカードよりも小さいカードに収まるのか

Qwen3.8 27Bは64層を備えているが、フルアテンションを使用するのはわずか16層だけである。残りの48層はGated DeltaNet線形アテンションを使用しており、増大し続けるキーバリューキャッシュの代わりに固定サイズのリカレント状態を保持する。モデルカードのブロックレイアウトは、Gated Attention → FFNが1つに対してGated DeltaNet → FFNが3つという3:1のハイブリッド比率である。実際の効果としては、KVキャッシュは同じコンテキストに対して従来の27B稠密モデルが必要とする量のおよそ4分の1で済む。今週のコミュニティ測定によると、8Kコンテキストで約0.5GB、32Kで2.0GB、最大262Kのネイティブウィンドウ全体では16.4GBとなっている。これは従来のアドバイスを覆すものだ——VRAMの予算のほとんどはコンテキストではなく重みに使われ、24GBのカードならQ4_K_Mを64K〜96Kのコンテキストで余裕を持って実行できる。さらにllama.cppの--cache-type-kフラグを使用すればキャッシュ自体を量子化できるため、キャッシュをさらに縮小できる。

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

初日にあなたをつまずかせる3つの落とし穴

古い llama.cpp ビルドはこのファイルを拒否します。GGUF は新しい qwen35 アーキテクチャを登録しているため、最新のビルドが必要です。リリース週より前のビルドは、アーキテクチャエラーで読み込みを拒否します。ダウンロードする前に、まず llama.cpp を更新してください。

テンプレートの罠。公式のJinjaチャットテンプレートは、推論トレースが空であってもすべてのアシスタントターンをthinkブロックで包むため、マルチターンのチャットではネストされたブロックと切り詰められた履歴が発生し、モデルがあなたの言ったことを忘れたように見えます。llama.cpp を --jinja 付きで実行し、修正された chat_template.jinja を同梱するパックを選んでください。

Visionには別のファイルが必要です。テキストはそのまま動作します。画像や動画は、mmprojプロジェクター(約0.9GB)も読み込まない限り、何も起こりません。unslothのGGUFリポジトリページには記載されていないので、ベースリポジトリまたはggml-orgパックから入手してください。ドキュメントやスクリーンショットを入力する予定がある場合は、サーバーコマンドに--mmprojを追加してください。

実行する:コマンド

llama.cpp、最新のビルドを入手したら:

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

...そして、ビジョン機能が必要な場合は --mmproj Qwen3.8-27B-mmproj-bf16.gguf を追加してください。

Ollamaでライブラリエントリを使う場合: ollama pull qwen3.8:27b、次にollama run qwen3.8:27bを実行します。LM StudioとUnsloth DesktopはチャットテンプレートとRAMオフロードを自動的に認識するため、初回実行には最も手間のかからない方法です。

ローカル vs API:正直な経済学

GGUFは無料の道です:限界費用はゼロ、レート制限もなく、あなたのマシンから何も外部に出ません。ただし、絶対的な意味で安いルートというわけではありません。24GBのGPU(中古のRTX 3090または新品のRTX 4090、さらに電気代)を用意する必要があり、12GBのカードに載せた2ビットファイルは妥協した体験になります。

APIルートが存在するのは、ウェイトがApache 2.0のため、提供にかかる限界費用がほぼゼロで、誰でもホストできるからだ。Qwen3.8 27Bは本日よりOrcaRouterで利用可能で、入力トークン100万件あたり$0.33、出力トークン100万件あたり$2.40だ。これはプロバイダーのリスト価格をマークアップなしでそのまま反映したものだ。また、ウェイトがオープンであるため、レート制限付きの無料ティアもあり、リクエストあたり$0で、上限を超えるとHTTP 429を返す。代表的なケースとして、月間1000万トークンで入力が70%の場合、有料ティアでは約$9.51になる。すでにGPUを所有しているなら、ローカル実行の方がコスト面で有利だ。所有していないなら、サイドプロジェクト用にカードを買うよりトークンをレンタルする方が得だ。

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

この推奨が誤っている場合

24GBでのQ4_K_Mはデフォルトであり、万能な答えではありません。以下の場合は他のものを選択してください:

サーバーまたはワークステーションで最高品質が必要です — CPUとRAMオフロードを使用した29GBのQ8_0または54.7GBのBF16であり、4ビットファイルではありません。

Blackwell RTX 50シリーズカードを使用中です — NVFP4版は同じ24GBのVRAMで約1.5倍高速で、より長いコンテキストを実現するためにFP8 KVキャッシュを使用します。5090では、NVFP4はこのモデルにおいてあらゆるGGUFよりも優れています。

262K のフルコンテキストが必要です重みに加えて約 16GB のキャッシュを想定してください。これにより、24GB カードは Q3_K_M まで引き下げられるか、KV 量子化を余儀なくされます。

投機的デコーディングに依存する場合— ggml-org パックを選択してください。これはマルチトークン予測ヘッドを保持しており、一部の量子化版は約0.5GBを節約するためにそれを削除しています。

あなたは12GBしか持っていない — 正直に言うと、2ビット量子化の27Bモデルは、同じモデルを適切にサーブした場合よりも明らかに劣ります。ローカルの2ビット設定に踏み切る前に、無料のAPIティアを試してみてください。それで十分なら、GGUFはハードウェアが追いつくまで待てばよいでしょう。

結論

Qwen3.8 27Bは、妥協なく24GBカードに収まる珍しい27Bです。17.1GBのQ4_K_Mダウンロード、最新のllama.cppビルド、そして長いコンテキストにほぼコストがかからないほど安価なKVキャッシュを備えています。そのハードウェアを所有しているなら、そのファイルをダウンロードしてください。ビジョンには別のmmprojが必要であることを忘れず、マルチターン会話が忘れっぽく見える初回にはテンプレートの罠を予期してください。ハードウェアを持っていない場合、同じモデルは$0.33/$2.40のAPIで、無料のレート制限付きティアもあります。だから、気に入らない2ビットのファイルを実行する理由はありません。GGUFは無料の道ですが、もはや唯一の道ではありません。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube