{{1}}Qwen3.8-27B with Unsloth{{/1}} と表示されたヒーロータイトルカード。サブタイトルは {{2}}「ローカルで実行、量子化、またはファインチューニング」{{/2}}、ターミナルウィンドウのアイコンがあり、チップには {{3}}「UD-Q4_K_XL 17.9GB」{{/3}} と {{4}}「Studio no-config」{{/4}} と表示されています。
Guides & Insights

Unsloth での Qwen3.8-27B:ローカルで実行、量子化、またはファインチューニング

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

はい — Unsloth は Qwen3.8 27B を実行でき、Ali​baba の新しい Apache-2.0 モデルを自分の GPU に載せる最速の方法です。答えを一言で言うと: Unsloth Studio を開き、「Qwen3.8 27B」を検索して、UD-Q4_K_XL (17.9GB)を24GBカードで選択すれば、1分以内にチャットを始められます。そのクリックの裏で、Unsloth はウェイト公開と同じ週(2026年8月13〜14日)に3つのものをリリースしました: unsloth/Qwen3.8-27B-GGUFパック(Unsloth Dynamic V3.0 (プレビュー) 量子化に基づく)、Unsloth Studio と Desktop での完全サポート、そしてv0.1.800-betaリリース(GGUF エクスポート、imatrix 検出、VRAMフィットの改善を含む)。また、モデルのファインチューニングも可能で、Unsloth はトレーニングが2倍高速、VRAM 使用量が70%削減されると主張しています。Qwen3.8 27B は、270億パラメータのdenseなビジョン言語モデルで、ハイブリッドアテンションにより64層中16層のみがフルアテンションを使用します。そのため、4ビットファイルは、ほとんどの27Bモデルが動作しないカードにも収まるのです。

情報源について:{{1}}モデルの事実は公式情報であり、Hugging Face の Qwen3.8 27B モデルカードから取得、2026年8月15日に検証済みです{{/1}}。Unsloth のサポート、量子化サイズ、VRAM 要件、インストールコマンドは、同日付の Unsloth のリリースノートおよびドキュメントに基づくものです。API 価格は、同日時点の OrcaRouter のカタログに掲載されている現在の価格です。Unsloth の「2倍高速、VRAM 70%削減」および「同サイズのモデルとしては圧倒的に最強」という記述はベンダーの主張であり、独立に再現されたものではありません。

「Qwen3.8 + Unsloth」が意味するもの:4つの異なること

Unslothは4つの別々のものであり、キーワード検索結果はそれらを混同しています。どれが必要かを知ることがセットアップの半分です:

unsloth/Qwen3.8-27B-GGUF — Hugging Face上の量子化重みファイルで、21種類のクォントとビジョンプロジェクターが含まれています。Dynamic V3.0(プレビュー)で構築されており、2025年4月24日に発表されたこのモデルより前の旧バージョンであるDynamic 2.0ではありません。これは「ファイルをダウンロードする」ルートで、任意のllama.cppビルドから利用できます。

Unsloth Studio — Hugging Face Space からインストールまたは実行できるブラウザアプリです。モデルハブを検索し、量子化モデルをクリックして、ツールを使ってチャットできます。手動のテンプレートや推論パラメータの設定は不要です。

Unsloth Desktop — macOS、Windows、Linux向けのローカルGUIアプリで、Studioとトレーニングを統合したものです。「2倍速く、VRAM使用量70%削減」のファインチューニングはここにあります。

unsloth Pythonライブラリ — ノートブックやスクリプトで使用されるQLoRAファインチューニングAPI。from unsloth import FastLanguageModel から始まる。

Unslothのv0.1.800-betaのリリースノート(タイトルは「Release Qwen3.8 27B」)によると、Qwen3.8 27Bと2.4TパラメータのQwen3.8-2.4T-A95Bは「Unslothでローカルに実行できるようになり」、27Bは「Unsloth Dynamic GGUFsにより17GBのRAMで動作し」、「UnslothでQwen3.8 27Bをファインチューニングすることもできます」。同じリリースには、NVFP4クォントの追加、GGUFエクスポート前のディスク容量チェック、Studioでの実際のGGUF imatrixサポートの検出、そして調整可能なVRAM制限によりGGUFでの推論が最大10%高速化されることが含まれています。

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

quantは雰囲気ではなくVRAMで選べ

UnslothのメモリテーブルはRAMとVRAMの合計(またはユニファイドメモリ)で示され、これが公式ガイダンスです。4ビットのQwen3.8 27Bには17〜19GBが必要で、24GBのRTX 4090、RTX 5080、または24GBのユニファイドメモリ搭載Macが、快適な4ビット構成の現実的な下限となります。ほぼすべてのユーザーをカバーする3つの選択肢:

12GB → UD-IQ2_XXS(9.0GB) — 丸ごと収まる唯一のファイルです。目に見える品質の低下が生じます。その点を理解した上でこの選択をしてください。

16GB → 13.4GBのUD-Q3_K_XL — Unsloth自身のピッカーによると最高の3ビットファイル。

24GB → UD-Q4_K_XL at 17.9GB — 推奨される4ビットファイルであり、この記事のデフォルトの答えです。

48〜64GB → 31.5GBのUD-Q8_K_XL — ワークステーションまたはデュアルGPU構成でほぼロスレス。

unsloth/Qwen3.8-27B-GGUFのファイルリストとUnslothのドキュメント(いずれも2026年8月15日検証済み)に基づく完全なラダー構成は次のとおりです: UD-Q8_K_XL 31.5GB、UD-Q6_K_XL 25.9GB、UD-Q5_K_XL 20.2GB、UD-Q4_K_XL 17.9GB、UD-Q3_K_XL 13.4GB、UD-Q2_K_XL 10.7GB、UD-IQ3_XXS 11.9GB、UD-IQ2_M 10.3GB、UD-IQ2_XXS 9.0GB。標準のK量子化(Q4_K_M 17.1GB、Q8_0 29.0GB)も同梱されており、パックにはビジョンプロジェクター(mmproj-BF16、931MB)が含まれているため、ロードすれば画像や動画も機能します。Unslothはこのラダー全体を「Dynamic V3.0 (preview)」と呼んでいます。これは、1年以上前にリリースされたモデル向けに作られた、古い記事で見かけるDynamic 2.0よりも新しいバージョンです。

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

Unslothで3分で実行する

ワンクリックで始める方法: macOSまたはLinuxでは、`curl -fsSL https://unsloth.ai/install.sh | sh` を実行してから、`unsloth studio -p 8888` を起動し、`http://127.0.0.1:8888` を開きます。Windowsでは、`irm https://unsloth.ai/install.ps1 | iex` を実行します。完全にインストール不要にしたい場合は、UnslothのStudioはHugging Face Spaceとしても公開されています。ブラウザで開き、"Qwen3.8 27B"を検索して、お使いのメモリに合った量子化バージョンを選びます。Studioはサンプリングパラメータとチャットテンプレートを自動調整し、VRAMが不足するとRAMにオフロードし、マルチGPU構成も自動検出します。「設定不要」というのは本当で、今週のモデルを最速で実行する方法です。

「ファイル優先のルート:すでにllama.cppを使っているなら、quantを1つダウンロードして直接実行するだけです。これらはUnsloth自身のコマンドで、同社のドキュメントで検証済みです:」

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

これらのサンプリング値は、モデルカードが推奨する思考モード設定です。16GBカードでは、--includeグロブを*UD-Q3_K_XL*に置き換えてください。また、ビジョン機能が必要な場合は、パックのmmproj-BF16.ggufを指す--mmprojを追加してください。1つ注意点: llama.cppは最新ビルドである必要があります。このファイルは新しいqwen35アーキテクチャを登録するため、リリース週より前のバージョンでは読み込むことを拒否されます。

Unslothでファインチューニングする

ファインチューニングは、Unslothがその評判を築いている分野です。このライブラリは、標準のTransformers + PEFTと比較して、トレーニングが2倍速く、VRAM使用量が70%少ないと主張しており、これにより27BモデルでのQLoRAがコンシューマー向けGPU1枚で実現可能になっています。ファインチューニングのエントリポイントは、GGUFパックではなく、プレーンなunsloth/Qwen3.8-27Bリポジトリ(safetensors、28Bのファイルページ)です。このモデルに適用される標準的なUnsloth QLoRAパターンは次のとおりです:

unsloth から FastLanguageModel をインポートする

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

次に、データセットに対する標準のtrl.SFTTrainerループを実行します。そのスニペットはUnslothのドキュメントにある標準的なQLoRAパターンであり、トレーニングベンチマークの主張はUnsloth自身のもので、私が再現したものではありません。注意点が2つあります。Unslothのカーネルはテキストトランスフォーマーの層にパッチを当てるため、ビジョンエンコーダーは別途処理する計画を立ててください。また、このアーキテクチャは登場して間もないため、バージョンの不一致が大きなエラーを引き起こすので、unslothパッケージは現在のリリースに保ってください。

Unsloth Studioがあなたに代わって処理してくれること

GGUFを手動で実行するということは、コンテキストサイズ、RAMオフロード、ツール呼び出しの絶妙なバランスを取ることを意味します。Studioはそれをデフォルト設定に集約します。実際の空きメモリからコンテキストサイズを決定し、アイドル状態のビジョンモデルをアンロードしてチャットやトレーニング用のVRAMを解放し、マルチGPU構成を検出し、Web検索、コード実行、エージェント接続(Claude Code、Codex、MCP)を初期設定で接続します。v0.1.800-betaリリースでは、実際に問題となる部分も改善されました。GGUFエクスポートは長時間のマージを開始する前にディスク容量をチェックするため、途中で失敗することがなくなりました。StudioはエクスポートするGGUFが実際にimatrixをサポートしているかを検出するため、無駄な実行を避けられます。また、メモリガードはGPUメモリを過剰に予約しなくなりました。公開から3日しか経っていないモデルにとって、「設定不要」は実質的な仕事を果たしています。

ローカル無料 vs API有料:正直な経済事情

UnslothとAPIの核心的な違いは品質ではなく、ハードウェアを誰が所有するかです。Unslothは無料のルートです。トークンあたりの限界費用はゼロで、データはマシンから一切出ず、レート制限もなく、重みを完全に制御できます。ただし、絶対的な意味で無料というわけではありません。GPUと電気代は自分で用意する必要があり、12GBカード上の2ビットファイルは妥協した体験になります。Qwen3.8 27Bは高密度で視覚対応モデルなので、4ビットではコンテキスト処理前に17.9GBの重みが必要です。マシンを用意することが参加条件なのです。

このAPIルートが存在するのは、重みがApache-2.0であるため、誰でもほぼゼロの限界費用でホストできるからです。Qwen3.8 27Bは、現在OrcaRouterのカタログに登録されており、料金は、入力トークン100万あたり$0.33、出力トークン100万あたり$2.40で、このモデルは当社のインフラ上でセルフホストされており、ベンダー価格の上乗せはありません。262Kトークンのコンテキストウィンドウと、テキスト・画像・動画の入力に対応しています。重みがオープンなため、リクエストあたり$0のレート制限付きフリーティアもあります。一般的な1000万トークンの月間利用で、入力シェア70%の場合、有料ティアでは約$9.51になります。すでに24GBのカードをお持ちなら、コスト面ではローカル(自己ホスト)が勝ります。お持ちでない場合、そのレートでトークンをレンタルする方が、サイドプロジェクト用にカードを購入するよりも有利です。そして、フリーティアは、ハードウェアにコミットする前にモデルを試すための正直な方法です。

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

Unslothが間違った答えである場合

Unsloth Studio と GGUF パックは、単一のマシンには正しい選択です。しかし、以下の場合には間違った選択です:

Blackwell RTX 50シリーズのカードを所有しています。unsloth/Qwen3.8-27B-NVFP4の量子化版は、同じVRAM内でBF16より約1.5倍高速で、より長いコンテキストを可能にするFP8 KVキャッシュを使用します。その方法はvLLMまたはSGLangを経由するもので、GGUFやStudioではありません。

本番環境では、フルの262Kネイティブウィンドウまたは1M YaRN拡張が必要です。長いコンテキストでの高密度ビジョンモデルは重く、Unslothのコンテキストサイズ調整を使えばより短いコンテキストでうまく実行できますが、適切なKV管理を備えたサーバースタックがローカルアプリより優れています。

多くのユーザーにサービスを提供しています。Unslothはローカルアプリおよびファインチューニング用ライブラリであり、マルチテナントサーバーではありません。同時実行性、オートスケーリング、稼働時間の保証が必要な場合は、ホステッドエンドポイントを利用してください。

GPU がまったくない場合です。正直に言うと、12GB カード上の 2-bit 27B は、同じモデルを適切に運用した場合よりも明らかに劣ります。まず無料の API ティアを使ってみてください。それで十分なら、ユースケースが実証されてからハードウェアを購入しましょう。

視覚側をファインチューニングしたいのですね。 Unslothの高速化はテキストトランスフォーマー層を対象としており、完全なマルチモーダル・ファインチューニングには別のスタックが必要です。

結論

Qwen3.8 27B with Unslothは、今週時点で解決済みの問題です:{{1}}Studioをインストールし、24GBカードにはUD-Q4_K_XLを(16GBにはUD-Q3_K_XL、12GBにはUD-IQ2_XXSを)選べば、モデルは設定不要・トークンごとの課金なしで動作します{{/1}}。ファインチューニングの道は現実的であり、Unslothの速度性能の主張こそが、27B QLoRAが1枚のカードで実用的である理由です。量子化ラダーは{{2}}Dynamic V3.0(プレビュー)であり、古い記事が説明するDynamic 2.0ではない{{/2}}ことを理解してください。{{3}}llama.cppは最新版を維持してください{{/3}}。また{{4}}ハードウェアを所有していない場合、同じ重みは$0.33/$2.40のAPI(無料のレート制限付きティアあり)で利用できる{{/4}}ため、{{5}}気に入らない2ビットのファイルを実行する理由はありません{{/5}}。{{6}}ローカルは無料のルートであり、この重量クラスでは初めて、簡単なルートでもあります{{/6}}。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube