Qwen-Image-2.1の8ステップ高速化チェックポイントであるQwen-Image-2.1-Turboのヒーローカード。重みとともに保存された8ステップスケジュール、デフォルトでCFG 1、プレフィックスKVキャッシュの再利用、そして変更されていないQwen Research Licenceを示しています。
Engineering & Research

Qwen-Image-2.1-Turbo:スケジュールを重みへと移した8ステップのチェックポイント

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

のリポジトリがQwen-Image-2.1-Turbo2026年10月9日にHugging Faceに登場した。そして、これについて最も興味深いのはステップ数ではない。bfloat16の重み、実行可能なコード付きのモデルカード、ライセンスファイル、8枚のショーケース画像、そしてリリースを告知するQwen-Image-2.1プロジェクトのGitHubニュース一覧の1行がある。独自のブログ記事も、ベンチマーク表も、プレスサイクルも存在せず、その配布条件にも一切の変更はないQwen-Image-2.1の高速化チェックポイントであるTurboは、テキストから画像の生成と画像編集のためのもので、ベースモデル自身の例が用いる40ステップではなく、8回のデノイジングステップで動作する。また、サンプリングスケジュールがどこに由来するかをひっそりと変えてもいる——そしてそれこそが、コードを壊す部分なのだ。

リポジトリには実際に何が含まれているのか

カードは短く、異例なほど具体的であるため、確認済みのことと示唆されていることを切り分けるのが容易になる。

• 概要:このカードでは、Qwen-Image-2.1-Turbo を「8 回のデノイジングステップでテキストからの画像生成と画像編集を行うための、Qwen-Image-2.1 の高速化チェックポイント」と説明しています。これは新しいアーキテクチャではなく、新しいモデルファミリーでもありません。同じ 7B の視覚生成コンポーネントを、はるかに短いサンプリング軌道に合わせて再パッケージしたものです。

• 読み込み方法: Diffusers の QwenImage21Pipeline を通じて行われます。これはベースモデルが使用するのと同じパイプラインクラスで、チェックポイント名を差し替えたものです。リポジトリ自身のメタデータは、base_model: Qwen/Qwen-Image-2.1 と library_name: diffusers を宣言しており、2つ目のタグとして base_model:finetune:Qwen/Qwen-Image-2.1 を持っています。つまり、ベンダーがこれを兄弟モデルではなく、ベースチェックポイントのファインチューンとして説明しているのです。

• 維持されるもの: 同じ7Bの視覚生成アーキテクチャ、Qwen-Image-2.1と同じ7つの解像度プリセット(スクエア2048×2048、4:3は2400×1792、3:4は1792×2400、3:2は2528×1696、2:3は1696×2528、16:9は2752×1536、9:16は1536×2752)、そして同じ2つの機能——テキストからの画像生成と、指示に基づく画像編集。カードのショーケースはカテゴリ別に構成されています:ポートレート写真、人物のポーズと動き、透過RGBA生成、タイポグラフィとポスターデザイン、UIと情報レイアウト、単一画像の変換、複数参照の合成、そして4画像のインテリア合成です。

• 含まれていないもの: 評価数値は一切ありません。カード上には Turbo チェックポイントの Qwen-Image-Bench スコアはなく、ベースとの比較もありません。Qwen-Image-2.1 ラインのどこにも唯一存在するスコアは、依然としてベースモデル自身の Qwen-Image-Bench 結果であり、これはベースチェックポイントで測定されたベンダー報告値で、このチェックポイントのものではありません。

Screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1-Turbo, captured in English, showing the Text-to-Image, Diffusers, Safetensors and QwenImage21Pipeline tags, 25 likes, the qwen-research licence label, and the introduction text describing it as an accelerated checkpoint of Qwen-Image-2.1 for text-to-image generation and image editing with 8 denoising steps that loads directly with QwenImage21Pipeline in Diffusers

スケジュールは今や重みの中に宿っており、それこそが本当の変化だ

カード上で最も重要な一文はこれなのに、インストール手順の下に埋もれてしまっている。そのチェックポイントは「推奨のサンプリングスケジュールを含んでいるので、スケジューラを手動で設定しなくてもすぐに使える」。

次に、その結果がサンプリングの節で明快に述べられている:「推奨される8ステップのサンプリングスケジュールはチェックポイントとともに保存され、自動的に読み込まれる。num_inference_steps を設定するだけでは、それを上書きしない。」

これを2回読んでください。多くの人が頭に思い描いているDiffusersの慣例では、ステップ数は呼び出し時の引数です。ベースモデルには num_inference_steps=40 を渡し、蒸留チェックポイントには num_inference_steps=4 を渡すと、パイプラインがそれに合わせてスケジュールを構築します。Qwen-Image-2.1-Turbo はその慣例を打ち破ります。8ステップのスケジュールはリクエストパラメータではなく、チェックポイントのメタデータです。別の整数を渡しても、パイプラインは依然として保存済みのスケジュールを使用します。モデルカードには、これを上書きする唯一の方法は呼び出し時に明示的な sigmas 引数を渡すことだと記載されており、さらに他のスケジュールは「このチェックポイントに対して評価されていない」と付け加えられています。

実際的な結論は再現の罠だ。Qwen-Image-2.1 のモデルカードから流用したコードを Turbo リポジトリに向けても、実行はでき、エラーも出ず、Turbo のショーケースが示す出力は生成されない。また、パイプラインで設定されたサンプリングシグマを理解する Diffusers ビルドも必要になる。そのサポートは Diffusers PR #14950 で追加されたが、執筆時点ではタグ付きリリースではなくソースツリーにある。記載されているインストール内容は、CUDA 対応の PyTorch ビルドに加えて、git+https://github.com/huggingface/diffusers.git、transformers>=5.17.0、accelerate、pillow です。

さらに2つのデフォルトは、あなたが設定したものではなくカードに由来する。生成はデフォルトでCFG 1を使用し、プレフィックスKVキャッシュは「denoisingステップをまたいでテキストと参照画像のコンテキストを再利用する」。CFG 1はclassifier-free guidanceパスを行わないことを意味し、これがトラジェクトリを破綻させることなく短縮する仕組みの大部分を占めている——そしてカードがguidance scaleの推奨をわざわざ載せていないのも、同じ理由からだ。プレフィックスKVキャッシュはベースモデルから受け継いだもの、すなわちQwen-Image-2.1がテキストと参照画像のコンテキストを再利用するために用いているのと同じメカニズムであり、denoisingループがわずか8回の反復しかない場合には、その重要性は下がるどころかむしろ増す。

変更履歴で発表、リポジトリとして提供

このリリースに当てはまる枠組みは「ローンチ」でも「リーク」でもない。それは、ニュース一覧に日付付きの一行として載っているチェックイン済みの成果物だ。Qwen-Image-2.1プロジェクトのGitHubニュース一覧には、2026.10.09付のエントリが2件ある。1件はTurboチェックポイントに関するもので、もう1件はQwen-Image-2.1 ProとTurboのAPIがAlibaba Cloud Model Studioで「正式に提供開始となった」ことを記している。Turbo専用のブログ記事はなく、カード上のブログリンクは2026年9月20日のQwen-Image-2.1ブログを指している。

それを、ベースモデルが3週間前に登場したときの状況と対比せよ。Qwen-Image-2.1のニュースリストには、重みに関する日付付きのエントリがあり、その後同じ日にさらに5件ある:PR #14804経由の初日からのDiffusersサポート、初日からのネイティブComfyUIサポート、ステップワイズ実行、プレフィックスKVキャッシュ、FP8量子化、テンソル並列処理を備えたvLLM-Omniサポート、Cache-DiTとCUDAグラフを備えたSGLangサポート、そしてLightX2Vによる初日からの高速化。Turboチェックポイントにはそうしたものは一切ない。それらのエコシステムのエントリはすべてQwen-Image-2.1を指している。

Screenshot of the GitHub repository page for QwenLM/Qwen-Image-2.1, captured in English, showing the file listing with the README and LICENSE and the most recent commit message reading 'docs: announce Qwen-Image-2.1-Turbo and API availability' committed 27 minutes ago

リポジトリのカウンターは、価値ではなく成熟度について同じことを物語っており、それは評決ではなくスナップショットにすぎない。執筆時点で、Qwen-Image-2.1は過去1か月に122,311回ダウンロードされ、3,142のいいねを獲得している一方、ほんの数時間前に登場したQwen-Image-2.1-Turboは33のいいねを示している。ダウンロード数は遅行指標であり、Turboの数字はこれから動く。今日それが教えてくれるのは、まだ誰もそれを実行する時間がなかったということだけだ。

8つのステップが教えてくれないこと

歩数は見出しであり、リリースの中で最も役に立たない数字でもある。その理由は三つあり、率直に述べておく価値がある。

• ステップは秒ではありません。カードもリポジトリも、Turboチェックポイントのスループット、レイテンシ、メモリを公開していません。7B bfloat16モデルにおける2048 × 2048での8ステップは、より小さいモデルでの8ステップとは異なるワークロードであり、そもそも測定値を報告していないため、カードにはどのハードウェアで測定されたかが記載されていません。

• 品質を測る基準はまだ存在しません。 Turboについて公表されたスコアはなく、ベースチェックポイントとの横並び比較も、どちらか一方についての独立した評価もありません。ショーケース画像は、ベンダーが推奨設定で選んだ出力です。それらはモデルが画像を生成する証拠ではありますが、ステップ削減と引き換えにどれほどの品質が犠牲になったかを示す証拠ではなく、ベンチマークの代わりにもなりません。

• メモリに関するガイダンスがありません。ベースモデルのカードにはメモリ最適化のセクションがあります。Turboのカードには、インストール、生成、編集、サンプリング、アスペクト比、および停止が記載されています。これを提供する予定なら、計測する前提で計画してください。

Summary card for Qwen-Image-2.1-Turbo with two columns: the left column headed 'Stated in the repository' listing 8 denoising steps, schedule saved with the checkpoint, CFG 1 by default, prefix KV caching across steps, the same seven resolution presets and the Qwen Research Licence; the right column headed 'Not stated anywhere' listing no quality score for this checkpoint, no speed or memory figure and no day-zero framework support

ライセンスは変更されておらず、これがソフトウェアを出荷する人にとっての最大のポイントです

Qwen-Image-2.1-Turbo は Qwen Research License Agreement に基づいてライセンスされています。リポジトリのメタデータには license: other、license_name: qwen-research、license_link: LICENSE と記載されており、リポジトリには重みとともに LICENSE ファイルが存在します。カード自体のライセンスセクションには、モデルは Qwen Research License Agreement に基づいてライセンスされている、という一文だけが記載されています。

高速化しても、その点は何も変わらない。ベースモデルの非商用研究ライセンスは、チェックポイントが高速だからといって商用ライセンスになるわけではなく、Turboリポジトリは同じ条件の下で別途ダウンロードするものだ。8ステップ生成への関心が、モデルを製品に組み込めるほど安価にすることにあるなら、制約となるのはライセンスであり、ステップ数ではない。その問いはベンダーに尋ねる必要があり、このリポジトリのどこにも答えはない。

ホスト型のパス、そしてその中でOrcaRouterがどこに位置するか

OrcaRouter は Qwen-Image-2.1-Turbo をルーティングしません。また、Qwen-Image-2.1 もルーティングしません。どちらも当社のカタログには掲載されておらず、本記事のいかなる内容も、それらを提供するという申し出として解釈されるべきではありません。どちらかが必要な場合、経路はベンダー自身の API と複数のサードパーティプラットフォーム、または Turbo チェックポイントの保存済みスケジュールを読み込めるほど新しい Diffusers ビルドで重み自体を使用する方法です。

私たちが前面に打ち出しているのはホスト型の画像ラインであり、自前ホスティングの実験と並べて見比べられるよう、そこに何が含まれているかを知っておく価値があります。OrcaRouter は 200 以上のモデルを 1 つの OpenAI 互換エンドポイントの背後に集約し、プロバイダーの定価のままマークアップなしで提供します——そのため、ベンダーが値下げすれば、価格改定の処理を待つことなく、その日のうちに私たちの側でも反映されます。プロバイダーが劣化した際の自動フェイルオーバーを追加し、リクエストが利用できるモデルとプロバイダーを表現するためのルーティング DSL、そして複数のモデルを 1 回の呼び出しに組み合わせるモデルフュージョンを備えています。私たちがルーティングする画像モデルは、OpenAI GPT-Image ファミリー、fast と ultra の各バリアントを含む Google の Imagen 4 の各ティア、Google の Gemini 画像プレビューエンドポイント、そして xAI Grok Imagine 画像エンドポイントです。

この判断の正直な輪郭:点検も改変もできる8ステップの7Bオープンウェイトモデルが必要なら、Turboはセルフホストの作業であり、先に決着をつけるべきはライセンスだ。今週中に本番環境で動く画像エンドポイントが必要なら、それは別の買い物であり、それが当社の売っているものだ。

何が言えるのか、そして何が言えないのか

• リポジトリ自体によって確認済み: 8回のデノイジングステップでテキストから画像生成と画像編集を実行するQwen-Image-2.1の7B高速化チェックポイント; num_inference_stepsで上書きされない保存済みのサンプリングスケジュール; デフォルトでCFG 1; テキストと参照画像コンテキスト用のプレフィックスKVキャッシュ; ベースモデルと同じ7つの解像度プリセット; QwenImage21Pipelineの読み込みパス; プロジェクト自身のニュース一覧にある2026年10月9日付のリリース項目; そしてベースモデルと同じQwen Research License Agreement。

• どこにも示されていない:Turboチェックポイントに関する品質測定、速度やメモリに関する測定、それが派生したベースチェックポイントに対する独立した評価、研究ライセンスを超える商用条件に関する記述、そしてQwen-Image-2.1が搭載していたようなday-zeroのフレームワーク対応のいずれも。

8ステップというのは、引用される数字のほうだ。重みに溶け込んだスケジュールこそが、最初の実行で何かが再現されるかどうかを決める細部なのだ。