
SGLang-DiffusionがDay ZeroでQwen-Image-2.1を提供:B200 1台で2.75秒生成
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image-2.1は2026年9月20日に公開され、SGLang-Diffusionチームはそれを待ち受けるサービングパスをすでに用意していた。この day-zero サポートは、モデルが担う3つの処理——テキストからの画像生成、複数画像の編集、透過RGBA出力——をカバーしており、さらにマージされたプルリクエストよりも珍しいものを持っている。実名のハードウェア上で測定されたレイテンシであり、それを生み出した構成とともに公開されているのだ。単一のNVIDIA B200上、1024×1024・40ステップの場合、SGLangの数値は生成で2.748秒、編集で3.358秒となる。これを支えるプルリクエスト sgl-project/sglang#39983 は9月17日にオープンされた——重みがダウンロード可能になる3日前である——だからこそ、これらの数値は「後日」の約束としてではなく、実際に存在しているのだ。
ここで「day zero」とは何を意味するのか、そしてなぜタイミングこそが興味深い点なのか
フレームワーク対応は通常、モデルのリリースとほぼ同時に発表され、実際に届くのは数週間後です。SGLangのケースは逆を行きます。実装はまだ公開されていないチェックポイントに対して書かれたため、作者は仕様書ではなく実際のアーキテクチャを扱うことを余儀なくされました。拡散トランスフォーマー、64チャンネルRGBA VAE、Qwen3-VL条件付け、複数参照画像入力、そしてRGBAの入出力です。
だからこそ、能力一覧よりもレイテンシ表を信頼すべきなのだ。一度もサービングされたことのないモデルには実測値がなく、ハードウェア、解像度、ステップ数、精度が付記された数値なら、同じカードを持つ人なら誰でも確認できる。SGLangの数値は、モデルに関する一般的な主張ではなく、特定の構成としてラベル付けされている。
残りのツール群も同じ時期に登場した。ComfyUIはネイティブサポートを提供し、DiffusersはQwenImage21Pipelineをマージし、vLLM-Omniはステップ単位の実行とFP8量子化を追加、LightX2VはROCm経由のAMD Radeonサポートによる高速化を追加した。フレームワークは、ラボの外の誰もがそれを利用できるかどうかを決める、リリースの一部なのだ。

数字と、それが語らないもの
SGLangの取り組みでは、スループットではなくリクエストごとのレイテンシが公開されています。この違いは、デモを動かすのではなくサービスをサイジングする場合に重要です。単一の2.7秒の生成は往復時間を示すだけで、1枚のカードで同時に何人ユーザーを処理できるかは分かりません。公開されている構成は、いずれも1024×1024および40ステップです:
• B200、常駐ウェイト、FlashAttention — 生成 2.748 秒、編集 3.358 秒。Q/K ノルムの修正と LayerNorm の変更により、それぞれ数パーセント短縮された。
• RTX PRO 6000 Blackwell、96 GB、常駐 — 生成 8.23 秒、編集 9.85 秒、ピークフットプリント 40.1 GiB。拡散トランスフォーマーをオフロードした場合は 10.28 秒と 10.66 秒で、ピークは 26.1 GiB に低下する。
• DGX Spark、1× GB10、eager、フル VAE デコード — 生成 35.36 秒、編集 42.23 秒、透過バリアントでは 35.49 秒と 42.21 秒。これらには PNG シリアライゼーションが含まれる。分割可能な CUDA グラフは同一のピクセルを生成し、測定可能な速度向上はなかった(35.96 秒 対 35.64 秒)。また、バッチ処理とマルチ Spark 構成はまったくベンチマークされていない。
• RTX 4090、24 GB、レイヤーワイズオフロード、デノイズのみ — SDPA 使用のベース BF16 で 26.69 秒、Cache-DiT で 10.31 秒(2.59×)、Cache-DiT と INT8 カーネルセットで 5.59 秒(4.77×)、Sage attention を追加して 4.74 秒(5.63×)。
その行には、正直な注意点が2つあります。1つ目は、これらが単一リクエストのレイテンシであること、そして4090の行はノイズ除去のみを測定しており、テキストエンコーダーとVAEは計測対象外であることです。2つ目は、SGLangの著者たちが、より広範な検証を評価的ではなく機能的であると位置づけていることです。BF16出力は配置が異なるとビット単位で完全一致するわけではなく、量子化やテンソル並列化によって数値は変化します。速くて異なることは、速くてより良いことと同じではありません。

なぜ透明出力パスこそが注目すべきものなのか
RGBAは、このモデルが、多くのチームがすでに呼び出している画像エンドポイントとは異なる点であり、同時に、サービングが厄介になる点でもある。Qwen-Image-2.1は、16×の空間圧縮を備えた64チャンネルのRGBA VAEを通じて、アルファチャンネルを第一級コンポーネントとして持つ潜在空間でノイズ除去を行う。透明性は、セグメンテーションモデルで後付けするポストプロセスではない。それはサンプラーが出力するものそのものである。
それをうまく提供するのは、RGBを提供するよりも難しい。出力はより大きく、VAEがデコードすべきチャネルは増え、リクエストにはスケジューラがルーティングしなければならない追加のモードビットが含まれる。SGLangの検証はまさにその領域をカバーしている——透明PNG出力、0~255の全範囲にわたって保持されるアルファ、単一サンプルにおける60.69 dBのRGBA PSNRであり、FP8構成も透明生成に合格している。これは品質ベンチマークではなく正確性のチェックであり、著者らもそう述べている。これはアルファチャネルが実在し、量子化後も生き残ることを示しているが、髪、毛皮、ガラスでエッジがきれいかどうかについては何も言っていない。
テスト済みの透過パスを備えたサービングスタックの実用的な価値は、3ツールのパイプラインを1回の呼び出しに変えられることにある。アルファ付きの生成、すでにアルファを持つ画像内での編集、通常のRGB写真から被写体を透明レイヤーに切り出すこと——これらはすべて同じエンドポイントを通る。
自分で GPU を実行していない場合、これがどこに当てはまるか
Qwen-Image-2.1のリリースで厄介なのは、呼び出せるホスト型エンドポイントが存在しないことだ。重みは約33 GBのダウンロードで、生成コンポーネントは7Bの拡散トランスフォーマーとQwen3-VL 8Bのテキストエンコーダーを組み合わせたもので、全体は2026年9月20日付のQwen Research License Agreementの下で提供される——非商用利用のみで、商用展開にはベンダーからの別途ライセンスが必要だ。つまりSGLangのレシピはAPIの代替ではない。それがAPIであり、運用者となるのはあなた自身だ。
それはルーティング層の目的を変える。OrcaRouterは200以上のモデルを、プロバイダー定価でマークアップゼロの1つのOpenAI互換エンドポイントの背後に配置する、プロバイダー間の自動フェイルオーバー、フォールバックを構成するためのルーティングDSL、パネル形式の呼び出し用のモデルフュージョンを提供する — しかし、いかなるバージョンのQwen-Imageモデルもルーティングせず、Qwen-Image-2.1がそこで呼び出せるルートになることは決してない。現実的なアーキテクチャは分割型だ:Qwen-Image-2.1をSGLang経由で自社ハードウェア上で実行し、透過的でマルチリファレンスな作業を行い、それ以外のすべてを1つのキーでホスト型画像モデルに送る。当社のカタログにはOpenAI GPT-Imageシリーズ、GoogleのImagen 4ティアとGemini画像プレビュー、xAIのGrok Imagine画像エンドポイントがあり、すべて定価をそのまま通過させているため、それらのいずれかのベンダー価格変更は同日に当社側で反映される。
デプロイとは実際にどのようなものか
SGLangのドキュメントには、このモデル用のクックブックがGPUごとのコマンド付きで用意されており、推奨されるサーバー起動方法は1行です — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed。テキストから画像へのリクエストはオプトイン方式の動的バッチ処理をサポートしており、画像編集リクエストは別のパスとして処理され、1つのリクエストで複数の出力を返すことができます。
実際に検証済みの構成は、互換性マトリクスが示唆する範囲よりも狭い。H200、B200、RTX PRO 6000 96 GB、RTX 5090、RTX 4090 は、透過バリアントを含む40ステップでの1024×1024生成および編集に対応している。さらに、マルチGPUテンソル並列、UlyssesおよびRing attention、レイヤーワイズ・オフロード、並列タイルドVAEデコード、Cache-DiT、CUDA graphs、オンラインおよびシリアライズドFP8量子化も含まれる。RTX PRO 6000上のマルチGPUおよびNVFP4レシピは未検証のままで、マルチホストRDMAとマルチランクの分離型ロールは未カバーである。計画に4枚のカードとファブリックが含まれるなら、公開されているエビデンスより先を行っている。

次に注目すべき点が2つある。1つ目は、レイテンシではなくスループットを公開する人が現れるかどうかだ。同時実行数の数字こそが、2.7秒という数値をキャパシティプランに変える。2つ目はライセンスだ。Qwen-Image-2.1の商用利用について、公開された価格もタームシートも存在せず、それが公開されるまでは、顧客に出荷されるあらゆるものにとって非商用制限がすべてとなる。
