
Qwen 3.7 Flash: 実際に画面を見るエージェント向けのAlibabaの超格安ビジョンモデル
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
アリババのQwenチームは、この2年間、考えられるほぼすべての価格帯と能力層にわたる充実したモデル群をリリースしてきた。そして2026年7月27日、もう1つのモデルが商用APIのリストとして静かに登場した:qwen/qwen3.7-flash。それは旗艦モデル発表のような派手さはなく、アリババはその技術レポート、ベンチマークスイート、アーキテクチャ図を公開していない。それに伴って登場したのは、ビルダーにとって別のリーダーボードスコアよりはるかに重要な説明文である:視覚言語推論モデル、100万トークンのコンテキストウィンドウ、そしてほぼ明細項目として認識されないほど低い価格。
安価で、巨大なコンテキストを持ち、画像をネイティブに「見る」という組み合わせにより、Qwen 3.7 Flashは、モデル市場全体で最も競争力があり最も有用なカテゴリの一つ、すなわち低コストのマルチモーダルな実用的主力モデルにしっかりと位置づけられています。これらはベンチマークのチャートで勝つようなモデルではありません。エージェントループ、ブラウザ自動化パイプライン、サポートツールの中で、1日に1000万回も呼び出されるモデルです。なぜなら、100万トークンあたり入力$0.03、出力$0.13というコストでは、コストが基本的に設計上の制約ではなくなるからです。
この記事はファーストルック解説です。Qwen 3.7 Flash が実際に何であるか、Alibaba が何を開示したか(そして重要なことに、何を開示していないか)、実際のトークン計算で経済性がどのように機能するか、そして Qwen ファミリーの他のモデル群——はるかに大規模な Qwen 3.8 や Qwen 3.7 Max を含む——や、Gemini 3.5 Flash-Lite のような低価格のマルチモーダル競合と比較して、どこに位置づくかを解説します。また、OrcaRouter のようなルーティングレイヤーがこのようなモデルをどのように扱うかも見ていきます。ヒーローモデルとしてではなく、マルチモーダルトラフィックの大部分を静かに吸収するデフォルト層として扱うのです。
要約
Qwen 3.7 Flash は、Alibaba の Qwen チームによる視覚言語モデルで、モデルID qwen/qwen3.7-flash として2026年7月27日から掲載されています。マルチモーダルエージェント、ビジュアルコーディング、検索、コンピューター/UI操作向けに構築されており、物体認識と空間理解に強みがあるとされています。対応するコンテキストウィンドウは100万トークンで、価格は入力100万トークンあたり0.03ドル、出力100万トークンあたり0.13ドル — これは現在入手可能な視覚対応モデルの中でも最も安価な部類です。最大出力長、正確なパラメータ数、アーキテクチャは公式には非開示です。コミュニティの推測では、小規模な mixture-of-experts 設計と、オープンウェイトの Qwen 3.7 リリースの前身である可能性が指摘されていますが、これは確認されていません。これは、Qwen 3.8(Alibaba が別途発表した2.4Tパラメータのオープンウェイトフラッグシップ)や Qwen 3.7 Max(同じ世代のより大規模なフラッグシップ)とは異なる、より小型で安価なモデルです。Artificial Analysis を含む独立したベンチマークスイートはまだこれを評価しておらず、第三者による数値が存在するまでは、品質に関する主張は初期段階かつ未検証のものとして扱うべきです。

重要なポイント
• Qwen 3.7 Flash は vision-language であり、テキスト専用ではない — マルチモーダルエージェント、ビジュアルコーディング、検索、およびコンピュータ使用タスク向けに位置付けられており、一般的なチャット向けではない。
• 価格は入力トークン100万個あたり0.03ドル、出力トークン100万個あたり0.13ドルで、現在市場に出回っているフロンティアに近いマルチモーダルモデルの最安値層とほぼ同等です。
• コンテキストウィンドウは1Mトークンであり、画像やスクリーンショットがトークンを急速に消費するため、これは一見したよりも画像を多用するマルチターンのエージェントセッションにとって重要です。
• リストの価格メモによると、繰り返しコンテキストでプロンプトキャッシュを利用すると、実効コストはリスト価格より60〜80%低くなる可能性がある——同じシステムプロンプトやスクリーンショット履歴を再生するエージェントループにとって、これは有力な手段となる。
• Alibabaは、最大出力トークン数、パラメータ数、アーキテクチャの詳細を公開していません。他の場所で読んだより具体的な情報は、コミュニティによる推測であり、ベンダーによる開示ではありません。
• これはQwen 3.8(2.4Tオープンウェイトのフラッグシップ)でも、Qwen 3.7 Max(同じリリース波における大規模なクローズドフラッグシップ)でもありません。名前の類似性はさておき、これらは3つの異なるモデルであり、それぞれ異なる役割を持っています。
• 独立したベンチマーク組織(Artificial Analysisを含む)は、本稿執筆時点でQwen 3.7 Flashのスコアを公開していません。つまり、品質はベンダーの説明以外では実際に証明されていません。
Qwen 3.7 Flashの実際の正体
命名規則を取り除けば、Qwen 3.7 Flashは、すべての主要ラボが今や抱いている疑問に対するAlibabaの答えである。その疑問とは、「視覚・エージェント・高トラフィックを、役立たずにならずに可能な限り安価に処理する」という設計方針全体を持つモデルはどのようなものか? GoogleはGemini FlashとFlash-Liteという階層で答え、OpenAIはminiとnanoのラインで答えた。Alibabaの答えは、今回の世代ではQwen 3.7 Flashである。
公式の説明は、マルチモーダルエージェント、ビジュアルコーディング、検索、そしてコンピューターやUI操作という4つのユースケースに焦点を当てています。これは非常に意図的に選ばれたリストです。「創造的な文章作成が得意」や「数学オリンピックの問題で強力な推論ができる」といったものではなく、モデルがスクリーンショット、ウェブページ、UIの一部、または視覚的にレンダリングされたコードの差分を見て、それに基づいて行動する必要がある仕事のリストです。Alibabaはまた、物体認識と空間理解を特に強みとして挙げており、これはコンピューター操作やUI操作の枠組みと一致します。つまり、ボタンをクリックしたり、レイアウトを読み取ったり、画面を操作するエージェントは、何が書いてあるかだけでなく、どこにあるかを知る必要があるのです。
この文脈で「推論」が何を意味するのか、明確にする価値がある。Qwen 3.7 Flashは視覚言語推論モデルとして説明されており、画像にキャプションを付けたり単一のルックアップ質問に答えたりするだけでなく、マルチステップの視覚タスクを遂行することが期待されている。つまり、「このスクリーンショットを説明してください」と「ここに3つのバリデーションエラーがあるフォームのスクリーンショットがあります。何が問題かを見極め、最初にどのフィールドを修正すべきか教えてください」の違いである。
スペックとマルチモーダル・エージェンティックフォーカス
こちらが実際に確認されているものと、そうでないものの完全なリストです。
確認済み:開発元はAlibabaのQwenチームです。モデルIDは qwen/qwen3.7-flash で、2026年7月27日から公開されています。マルチモーダル入力(画像と言語)に対応。コンテキストウィンドウは1,000,000トークンです。料金は入力1Mトークンあたり$0.03、出力1Mトークンあたり$0.13です。掲載ページの料金注記によると、同じシステム指示や参照画像を複数の呼び出しで再利用するワークロードでは、繰り返しコンテキストに対するプロンプトキャッシングにより、実効コストが表示価格より60〜80%削減される可能性があります。これは、毎ターン同じスクリーンショット履歴やツールスキーマを再送信するエージェントループにとって非常に重要な点です。
非公開: 最大出力トークン制限。 正確なパラメータ数。 アーキテクチャ(dense vs. mixture-of-experts)。 トレーニングデータの構成。 自社のベンチマークスコア。
コミュニティによる推測(そのようにラベル付けしてください、なぜならそれがすべてだからです):「Flash」という命名、攻めの価格設定、そしてAlibabaがこれまでのQwen世代で踏んできたパターンを考慮すると、一部の観察者はQwen 3.7 Flashが、トークンあたりの計算コストを低く抑えるために最適化された小規模なmixture-of-expertsアーキテクチャを使用しており、またそれが、最終的なオープンウェイトのQwen 3.7リリースに先立つプレビューまたは蒸留ステップである可能性があると推測している。これは、以前のQwenの「flash」や「turbo」のバリアントが、より広範なオープンリリースに先行することがあったのと同様である。このいずれもAlibabaによって確認されていない。公式のテクニカルレポートまたはモデルカードが別段のことを示すまでは、これは情報に基づいた推測であり、事実ではないと扱ってほしい。
公開された最大出力数値がないことは、このモデルを利用して構築する人にとって注意すべき点です。ユースケースが長い構造化出力(大規模なJSONペイロード、複数ファイルのコード生成、長いトランスクリプト)を生成する場合、実際の出力上限を本番環境で採用する前に経験的にテストしてください。なぜなら、存在しない数値をドキュメントで確認することはできないからです。
価格の具体例:実際のコスト
こんな小さな数字は見逃しがちなので、きちんと計算してみましょう。
入力トークン100万個あたり$0.03、出力トークン100万個あたり$0.13の場合、2,000個の入力トークン(適度なサイズのスクリーンショットと短い指示)と300個の出力トークン(構造化された回答)を使用した1回の呼び出しの費用は次のようになります。入力: 2,000/1,000,000 × $0.03 = $0.00006、出力: 300/1,000,000 × $0.13 = $0.000039。合計: 約$0.0001(1回の呼び出しあたり) — 100分の1セント。
これを大量実行にスケールしてみましょう。そのような呼び出しを100万回実行するとします。これは、スクリーンショット分析やUI状態チェックを行う中規模のエージェント製品にとって妥当な1日の負荷です。すると、次の計算になります。1,000,000 × 2,000 = 20億入力トークン × $0.03/1M = $60、加えて1,000,000 × 300 = 3億出力トークン × $0.13/1M = $39。合計: 100万回のビジョンエージェントの呼び出しに対して、約99ドル。さらに、プロンプトキャッシュを組み込む前であっても(リストの注記によれば、繰り返しコンテキストのワークロードではこれを60〜80%削減できる可能性があります)、これはほとんどのチームが予算会議なしで承認できる金額です。
次に、より重いシナリオを比較してみましょう。コンピュータ使用エージェントが、実行中の50,000トークンのコンテキスト(スクリーンショット、アクション履歴、ツール結果)を保持し、ステップごとに500トークンのアクションを生成し、1日あたり100,000回実行されるとします。入力コスト:100,000 × 50,000 = 50億トークン × $0.03/100万トークン = $150/日。出力コスト:100,000 × 500 = 5,000万トークン × $0.13/100万トークン = $6.50/日。つまり、おおよそ$156/日、つまり約$4,700/月、かなり積極的な長文脈のエージェントワークロードの場合です——そして、これはその50Kコンテキストの繰り返し部分に対するキャッシュ割引を考慮する前の話です。コンピュータ使用ループ(同じシステムプロンプト、同じツール定義、重複する画面状態)において、これはまさにプロンプトキャッシングが作られたタイプのワークロードです。

実世界シナリオのウォークスルー
高負荷ビジョンタスク
何百もの商品画像を毎日分類、タグ付け、属性抽出する必要がある商品カタログパイプラインを想像してください。このようなワークロードでは、トークンごとのコストが急速に積み重なり、中堅のビジョンモデルでは予算を圧迫しますが、Qwen 3.7 Flashの価格設定では手頃な範囲に収まります。Alibabaが明示的に挙げている物体認識と空間理解という2つの能力は、「この画像に何が写っているか、どこにあるか、状態はどうか」に直接対応します。
ビジュアルコーディング
「ビジュアルコーディング」という名前のユースケースは、次のようなワークフローを想定しています。レンダリングされたUIのスクリーンショットと、その基盤となるコンポーネントコードをモデルに入力し、不一致を特定するよう指示する、またはFigmaのエクスポートを受け取り、初回実装を返すといったものです。これは、テキストのみのコードモデルに特に不利なタスクカテゴリです。レイアウトのバグを言葉で説明することはできますが、実際に壊れたパディングや位置がずれたボタンを視認できるモデルの方が、より速く、より確実に診断できます。
エージェント的 / コンピューター使用
これは主力ユースケースです。コンピュータ操作エージェントは、画面を見て、クリック可能な要素を理解し、アクションを決定し、それを繰り返す必要があります。多くの場合、タスクごとに数十のステップを要します。この経済性は、高価なモデルにとっては厳しいものです。30ステップのブラウザまたはデスクトップ自動化タスクでは、各ステップに新しいスクリーンショットが含まれるため、タスク完了前に数十万トークンに達する可能性があります。最先端モデルの価格設定では、タスクごとに実際のコストがかかりますが、Qwen 3.7 Flashの価格設定では、1日数千のセッションを実行しても、小規模チームの予算内に収まります。
検索
ビジュアル検索(画像をコーパスと照合する、取得結果が実際に参照写真と一致することを確認する、検索クエリをユーザーが見ているスクリーンショットに基づいて具体化するなど)は、大きなコンテキスト(複数の候補画像や長い取得文書セットを保持するため)と低い呼び出しコスト(検索・検証のループはユーザークエリごとに1回ではなく多くのモデル呼び出しを伴うため)の両方を備えることでメリットを得ます。
Qwen 3.7 Flash へのアクセスと使用方法
Qwen 3.7 Flash を呼び出す際のモデル識別子は qwen/qwen3.7-flash であり、OpenAI 互換のツールであればどれでも動作します。つまり、既存の chat-completions や responses スタイルの統合は、モデル名を変更するだけでこれを指定でき、クライアントコードを書き直す必要はありません。また、ここで OrcaRouter のようなルーティング層が理論ではなく実用になります。各サービスに単一のモデルをハードコードする代わりに、統合された OpenAI 互換エンドポイントを使えば、視覚およびエージェント系トラフィックのデフォルト層として、安価で高性能なマルチモーダルモデルを設定し、実際にそれらを必要とする一部のリクエストには、より高価な推論モデルを温存できます。「非常に安く、かなり有能で、最前線では未検証」という価値提案全体を持つモデルにとって、そのような階層型ルーティング(デフォルトで安価、必要なときにエスカレーション)は、単一の未検証モデルにパイプライン全体を賭けるのではなく、本番環境にデプロイする正しい方法と言えるでしょう。
標準的なマルチモーダルリクエスト形式が適用されます。同じメッセージ内でテキストと画像を併用でき、複数画像・複数ターンのセッション向けの大きなコンテキストウィンドウ、そして使用状況ダッシュボードに明確に表示されるトークン単位の課金もその対象です。最大値は公開されていないため、実際のワークロードで出力長の実用的な上限をテストしてから依存するようにしてください。
正直な限界と未確認なこと
ここで本当に未知であることを率直に言えば、本稿執筆時点では、Artificial Analysis やそれに匹敵する評価機関による Qwen 3.7 Flash の独立したベンチマークデータは存在しません。その品質に関するすべて——視覚推論での実際の性能、エージェント的な多段階タスクでの信頼性、長文脈シナリオにおける妨害要素への耐性——は、現時点では第三者による標準化テストスイートでの実行結果ではなく、Alibaba 自身のポジショニング表現によってのみ裏付けられています。ベンダーの説明と独立した検証は同一ではなく、読者はその検証が存在するまで、このモデルの能力をそれに応じて評価すべきです。
ベンチマーク以外の情報として、Alibabaはアーキテクチャ、パラメータ数、最大出力長を開示していません。コミュニティで流布している「小規模MoE、オープンウェイトのQwen 3.7の前身となる可能性」という説は、命名パターンと価格設定に基づく妥当な推測ではありますが、あくまで憶測であり、Alibabaが確認したものではありません。モデルの透明性(公開されたアーキテクチャ、オープンウェイト、テクニカルレポート)があなたのユースケースの要件であるなら、Qwen 3.7 Flashは現時点でその基準を満たしていません——APIリスト以外の公開ドキュメントが最小限しかない、クローズドでAPI専用のモデルです。
比較方法:Qwen 3.8、Qwen 3.7 Max、そして格安ライバル
ここでの命名は人を惑わせるため、正確にすることが重要です。Qwen 3.8は、Alibabaが別途発表したオープンウェイトのフラッグシップで、2.4兆パラメータの設計を中心に構築されているとされています。— これは根本的に異なるモデルであり、目的も異なります。フロンティアで競うための大規模でオープンな汎用モデルであり、安価なマルチモーダルユーティリティ層ではありません。Qwen 3.7 Maxは、この同じ「3.7」リリースウェーブの中で、より大規模でおそらくより高性能なクローズドフラッグシップです。コストに関係なく最高品質が必要なタスクに使用するモデルです。Qwen 3.7 Flash、本記事の主題であり、その星座の中で3番目で最も安価なポイントです。小型で高速、大幅に低コストであり、汎用的な優秀さではなく、特にマルチモーダルエージェントワークロードに特化しています。これらの3つのモデルのうち2つが同じバージョン番号を共有しているからといって、機能や振る舞いが引き継がれるとは考えないでください。— それらは異なる仕事を持つ異なるモデルです。
外部競合と比べた場合、最も近い比較対象はGoogleのGemini 3.5 Flash-Liteであり、同様のニッチを占めています。低コストでマルチモーダル、高スループットの階層であり、まさに前述のような大量のワークロードを対象としています。両モデルは主に、トークンあたりの価格、コンテキスト長、マルチモーダル処理という同じ軸で競合しており、どちらもフロンティア推論モデルとして位置づけられていないため、生の推論ベンチマークでは競いません。Qwen 3.7 Flashの独立したベンチマークデータがないため、Gemini 3.5 Flash-Liteとの直接比較による品質主張をこの記事で責任を持って行うことはできません。言えることは、Qwen 3.7 Flashの価格設定はその階層と競合するかそれ以下であり、その1Mコンテキストウィンドウはこのコスト帯のモデルとしては寛大であり、まさに、価格だけで選ぶのではなく、低コストのマルチモーダル階層を実際のワークロードで実証的にテストする価値があるようなギャップを生み出しているということです。
よくある質問
Qwen 3.7 Flash とは何ですか?
阿里巴巴(Alibaba)のQwenチームによる視覚言語推論モデルで、マルチモーダルエージェント、ビジュアルコーディング、検索、コンピューター/UI操作向けに構築されています。2026年7月27日以降、モデルID qwen/qwen3.7-flash で登録されています。
Qwen 3.7 Flashの料金はいくらですか?
100万入力トークンあたり0.03ドル、100万出力トークンあたり0.13ドル —— 現在利用可能な視覚対応モデルの中でも最安クラスのひとつであり、記載によれば、繰り返しのコンテキストに対するプロンプトキャッシュ利用により60〜80%のさらなる割引が可能です。
コンテキストウィンドウとは何ですか?
100万トークン。
Qwen 3.7 FlashはQwen 3.8と同じですか?
いいえ。Qwen 3.8はAlibabaが別途発表した2.4兆パラメータのオープンウェイト・フラッグシップモデルです。Qwen 3.7 Flashは、はるかに小型で低コスト、閉じたマルチモーダルモデルであり、目的が異なります。どちらもAlibabaのQwenシリーズに属していますが、混同すべきではありません。
Qwen 3.7 Flash は Qwen 3.7 Max と同じですか?
いいえ。Qwen 3.7 Maxは、同じ「3.7」リリースウェーブにおける大型のフラッグシップモデルです。Qwen 3.7 Flashは、小型で高速かつ非常に低価格な階層であり、最高品質の出力ではなく、大量のマルチモーダルおよびエージェントタスクを目的としています。
Qwen 3.7 Flash は画像に対応していますか?
はい、それは視覚言語モデルです。マルチモーダル(画像とテキスト)入力を処理し、物体認識、空間理解、ビジュアルコーディング、コンピュータ/UI操作といった視覚タスクに特化して位置づけられています。
最大出力長は何ですか?
アリババから公式に開示されていません。本番環境のワークロードを構築する場合は、数値を想定するのではなく、実用的な出力上限を直接テストすべきです。
Qwen 3.7 Flash は mixture-of-experts モデルですか?
未確認。コミュニティの中には、価格設定と命名パターンから、小さなMoEアーキテクチャを使用していると推測する人もいる。しかし、Alibabaはアーキテクチャの詳細を公開していないため、これは推測に過ぎず、事実ではない。
それはGemini 3.5 Flash-Liteと比べてどうですか?
両方とも、低コストで高スループットのマルチモーダル層を占めており、生の推論ベンチマークではなく、主に価格とコンテキスト長で競い合っています。Qwen 3.7 Flashの品質を決定的に比較するための独立したベンチマークデータはまだありません。
Qwen 3.7 Flash はどこでアクセスできますか?
OpenAI互換の任意のクライアントを介してモデルID qwen/qwen3.7-flashを使用するか、OrcaRouterのようなルーティングレイヤーを通じて使用します。OrcaRouterでは、これを他のモデルと並んでデフォルトの低コストなマルチモーダルティアとして設定できます。
Qwen 3.7 Flash は良いですか?
本稿執筆時点では独立した検証が未実施であり、第三者のベンチマーク機関(Artificial Analysisを含む)からスコアは公表されていません。その価値提案は価格とコンテキストサイズにあり、実証された品質の優位性ではありません。そのため、本番投入前に、ご自身の特定のワークロードに対して経験的にテストする価値があります。

結論
Qwen 3.7 Flashはリーダーボードで勝とうとしているわけではなく、アリババはたとえそうしたいとしても、確認するためのドキュメントを誰にも提供していません。このモデルが目指しているのは、ビジョン&エージェントのワークロード(スクリーンショット分析、ビジュアルコーディングチェック、コンピュータ使用ループ、ビジュアル検索)を十分に低価格にし、コストが機能を構築しない理由にならないようにすることです。100万トークンあたり0.03ドル/0.13ドル、1Mトークンのコンテキストで、その経済性は、どの品質層のモデルでも匹敵するものがほとんどない方法で、高ボリュームかつ常時稼働のマルチモーダルエージェントトラフィックを真にサポートします。ただし、正直なところギャップがあります: 独立したベンチマークがない、アーキテクチャや最大出力長が開示されていない、そして確立された低価格帯の競合(Gemini 3.5 Flash-Liteなど)に対してどの程度通用するかについての実際の不確実性です。これを、今すぐテストする価値のあるマルチモーダルエージェントワークロード向けの、有望で非常に手頃なデフォルトとして扱ってください。そして、Qwen 3.8やQwen 3.7 Maxとは頭の中で明確に区別してください。これらはまったく異なる問題を解決する別のモデルです。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
