Gemini 3.5 Flash-Lite vs Qwen 3.8:安価な実用モデル vs 2.4Tフラッグシップ
Guides & Insights

Gemini 3.5 Flash-Lite vs Qwen 3.8:安価な実用モデル vs 2.4Tフラッグシップ

著者

Jim Song

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

この比較が最初に書かれた時点では、それは珍しい形で一方的なものでした:Gemini 3.5 Flash-Liteは実際に購入できる製品であり、Qwen 3.8は価格もベンチマークも重みもない限定プレビューで、比較できる要素はほとんどありませんでした。

もはやそういう状況ではありません。 Qwen3.8-Maxは2026年8月3日に一般提供を開始し、公開された料金表(100万トークンあたり$2/$6)、OpenAIおよびDashScope互換のエンドポイント、完全なベンチマーク表を備えています。セルフサービスで予算管理が可能で、OrcaRouterを含めて稼働中です。そこで本記事はゼロから書き直しました。今日の正直な比較は「出荷済みモデル対架空の製品」ではありません。真のティア比較です。Googleの最も安価な高スループット実用機と、Alibaba最大のフラッグシップとの比較です。

ビルダーへの注意——この2つはコスト曲線の両端に位置するため、正しい問いは、あなたのワークロードがどの層に属するかです。OrcaRouterは200以上のモデルを単一のOpenAI互換エンドポイントの背後に配置しているため、2つのSDKを接続することなく、同じタスクで両方をテストできます。

TL;DR 判定. これらのモデルは実際には競合していません — 異なる問いへの答えだからです。Flash-Lite は効率重視のモデルです: Artificial Analysis Index 36$0.30 / $2.50 (1Mトークンあたり)、およそ 490トークン/秒で、一般提供されています。あらゆるリクエストで無視できるコストで実行できるよう設計されています。Qwen3.8-Max はフラッグシップです: 約2.4Tパラメータ、100万トークンの定額コンテキスト、ネイティブの画像・動画入力、および自己申告によるフロンティア級のスコア (GPQA Diamond 92.6、Terminal-Bench 2.1 86.6) — 価格は$2 / $6で、Flash-Lite の入力価格の6.7倍です。Flash-Lite は、大量の分類・ルーティング・抽出処理に適したデフォルトの選択肢です。Qwen3.8-Max は、タスクが本当にフロンティア級の推論、100万トークンのコンテキスト、またはテキスト以外の入力を必要とする場合に切り替える先です。変わっていない唯一の注意点: Qwen には依然として独立したベンチマークスコアがありません。

重要なポイント

Qwen 3.8 が一般提供開始 — 2026年8月3日時点で、価格設定、セルフサービスアクセス、ベンチマーク表が公開されています。以前のゲート付きで予算化不可能なプレビューという位置づけは廃止されました。

Flash-Liteは劇的に安い: $0.30 / $2.50(1Mあたり)、Qwenの$2 / $6 に対して、入力で約6.7倍、出力で約2.4倍です。

Flash-Liteははるかに高速です:およそ490トークン/秒で、高スループットの作業向けに作られています。Qwen3.8-MaxはOrcaRouterの7日間テレメトリで最初のトークンまでの時間(p50)が1.64秒を示しますが、大きくて徹底したモデルです。

Flash-Liteだけが監査済みスコアを持っています: Artificial Analysis Index 36。Qwen3.8-Maxは未評価のままであり、Alibabaが現在独自の数値を公表しているものの、どの独立した評価機関からも評価されていません。

Qwenは能力面で圧倒的に勝利します:1つの1Mトークンコンテキストをフラット課金で提供し、長いプロンプトの追加料金もなく、さらにテキスト/画像/動画入力と文書解析のOmniDocBench 1.5 92.1を備えています。Flash-Liteは小さな効率モデルです。

オープンウェイト:Qwenのオープンウェイトは今週中に提供される予定(ライセンスはまだ未公開)。さらに、Qwen3.8-27Bは約17GBのVRAMで動作すると報じられている。Flash-Liteは恒久的にクローズされた。

{{1}}正確性に関する注記:{{/1}} Qwen3.8-Maxの品質に関する数値はすべてAlibaba社による報告であり、第三者によって検証されていません。Gemini 3.5 Flash-Liteの数値はArtificial Analysisによるものです。{{2}}Qwenの価格{{/2}}はAlibaba Model StudioのGAレートカードに基づくものであり、本記事の以前のバージョンに記載されていたプレビュー期間中のアクセス情報に優先します。

スペックと価格、並べて比較

• メーカー / ステータス — Flash-Lite: Google; 一般提供中; Qwen3.8-Max: Alibaba; GA(2026年8月3日)

• ポジショニング — Flash-Lite: 低コストで高スループットの効率重視層; Qwen3.8-Max: フラッグシップ / フロンティアへの野心

• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: 未評価

• ベンダー報告のスコア — Flash-Lite: 順位は第三者測定;Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (すべてAlibaba報告)

• 価格(100万トークンあたり、入力/出力)— Flash-Lite:$0.30 / $2.50;Qwen3.8-Max:$2.00 / $6.00、100万トークンのコンテキスト全体で一律;キャッシュ入力は$0.25

• 速度 — Flash-Lite: ~490 tok/sec (Artificial Analysis);Qwen3.8-Max: p50 TTFT 1.64s (OrcaRouter 7日間のテレメトリ)

• コンテキスト — Flash-Lite: 効率向けコンテキスト; Qwen3.8-Max: 1Mトークン (思考時は983,616、最大出力は131,072)

• モダリティ — Flash-Lite: テキスト特化の効率モデル; Qwen3.8-Max: テキスト、画像、動画を入力 → テキストを出力

• 重み — Flash-Lite: 非公開、API限定;Qwen3.8-Max: 今週中に提供予定、ライセンスはまだ未定

• 本日よりアクセス可能 — Flash-Lite: 標準API、セルフサービス; Qwen3.8-Max: 標準API、セルフサービス (Model Studio、DashScope、OrcaRouter)

このように並べて比較すると、結果は以前とはまったく違う。Qwenの欄はもはや空白ではなく、埋まっており、いくつかの行ではより強い項目になっている。かつての「既知の実績対将来性」という枠組みに取って代わるのは、単純明快な階層差だ:Flash-Liteは入力コストが約6.7倍安く、スループットでは約13倍高速である。一方、Qwenは100万トークンのマルチモーダルコンテキストと、フロンティア級とされる推論を提供する。それらはどちらも正当な製品であり、ただ役割が異なるだけだ。

従来の注意が依然として当てはまる唯一の行は、ベンチマークの行です。Flash-LiteのIndex 36は、Artificial Analysisによって公開リーダーボード上で測定されました。Qwenのすべての数値(GPQA Diamond 92.6、Terminal-Bench 86.6、その他)は、Alibabaが自社のハーネスで算出したものです。これは何も公表しないよりは確実な改善ですが、第三者による検証ではなく、また研究所は自分たちが勝てるベンチマークを公表するものだからです。

Index 36 vs 未評価のフラッグシップ:正直に読むと

Flash-LiteのIndex 36をQwenのGPQA Diamond 92.6と並べて、圧勝だと宣言したくなるのはわかる。だがそれは二重のカテゴリーエラーである。

まず、Artificial Analysis Intelligence Indexは多くのタスクにわたる複合指標であり、GPQA Diamondは単一の大学院レベルの科学テストです。これらは同じ尺度上になく、互いに差し引くことはできません。

第二に、そしてもっと重要なことに、Flash-Liteは高いスコアを取るようには設計されていなかった。 インデックス36は、効率重視モデルの典型的な姿だ。Googleのエンジニアリング目標は、すべての受信リクエストの前に配置できるほど安価で高速なモデルを作ることだった。すなわち、チケットの振り分け、分類、抽出、大量の要約といった、フロンティアモデルでは経済的に非現実的な処理が対象だ。それを2.4Tのフラッグシップの推論上限と比較して評価するのは、このモデルの存在意義を見失っている。

私たちが言えることは、より限定的でより有用です。Qwen3.8-Maxは、おそらく実質的にはるかに高性能なモデルです。その自己報告の数値は、Index-36モデルが生み出すであろう数値をはるかに上回っており、FrontierSWEが前身の40.7から73.5へと跳ね上がったことは、実際の進歩を示唆しています。しかし、「非常に可能性が高い」というのは、依然として推論に過ぎません。独立した評価者がスコアを付けていないからです。参考までに、前世代のQwen3.7-Maxが記録したスコアは46で、AAインデックスでは、Flash-Liteの36よりは高いものの、最前線には遠く及ばず、そのためAlibabaが暗に示す世代間の飛躍は大きく、未検証です。

実務上の帰結:もしあなたのタスクをFlash-Liteがすでに正しく完了できるなら、Qwenのより高い性能上限はあなたにとって何の価値もなく、そのために6.7倍のコストを支払うことになります。上限が意味を持つのは、Flash-Liteが実際に失敗している場合だけです。

実際のコスト:数字で見るティア間格差

大量の分類ジョブを例に取ります:入力2,000トークン、出力200トークン、1日50万回実行される——現実的なサポートトリアージやコンテンツルーティングの形態です。

Flash-Lite: 1回あたり、0.002M × $0.30 = $0.0006、さらに0.0002M × $2.50 = $0.0005。 ≈ $0.0011/回 → 約$550/日。

Qwen3.8-Max:1回あたり、0.002M × $2 = $0.004、さらに0.0002M × $6 = $0.0012。≈ $0.0052/回 → ~$2,600/日。

• 月額: Flash-Lite ≈ 16,500ドル、Qwen ≈ 78,000ドル — 同じタスク量で61,500ドルの差。

その規模になると、ティアの選択がシステム内で最大の費用項目になります。効率性モデルが処理する作業にフラッグシップを選ぶことを正当化するのは非常に困難です。これはまさにFlash-Liteが存在するためのシナリオです。

さて、それを反転させてみましょう。長文書タスクを例にとります:コンテキスト60万トークン、出力5,000トークン、それを1日200回。

Qwen3.8-Max: 0.6M × $2 = $1.20、プラス 0.005M × $6 = $0.03。 1コールあたり ≈ $1.23、ロングプロンプトの追加料金なし—そしておよそ $0.18、コンテキストが$0.25/1Mでキャッシュされている場合。

Flash-Liteは、この形状に対してはまったく価格設定ができません。なぜなら、効率層モデルは600,000トークンの単一呼び出しコンテキストを保持するようには作られていないからです。

つまり、答えはワークロードの形状によってまったく逆転する。これこそが本当の教訓だ。Flash-Liteは、高ボリュームの短コンテキスト処理において圧倒的な差で勝利する。Qwenは、100万トークンまたはテキスト以外の入力を必要とするあらゆる処理で勝利する。そこではFlash-Liteは安価な選択肢ですらなく、単に選択肢にすらならないのだ。

シナリオ: どのティアが適合するか

大量のサポートトリアージとルーティング。明らかにFlash-Liteです。分類にはIndex 36で十分で、1コールあたり約$0.0011であれば全チケットで実行できます。曖昧な少数のケースのみ、より大きなモデルにエスカレーションしてください。

文書全体の契約書または提出書類の分析。 Qwen3.8-Max。100万トークンの定額コンテキストにより、400ページの文書でも追加料金なし・チャンク分割なしで1回の呼び出しで処理でき、自己報告によるOmniDocBench 1.5 92.1はまさにこの作業を対象としています。

スクリーンショット、チャート、またはビデオパイプライン。デフォルトではQwen3.8-Maxが画像・ビデオ入力を受け付け、実際のGUI操作でOSWorld-Verified 86.1を報告します。Flash-Liteは非テキスト入力の候補ではありません。

エージェンティックコーディング。 主張されている数値(Terminal-Bench 2.1 86.6、FrontierSWE 73.5)におけるQwen3.8-Maxだが、いずれも独立に検証されておらず、自己報告の中で最も低いスコアは指示追従のIFBench 82.8であるという注意点がある — 各ステップの出力を解析するパイプラインにとっては現実的なリスクだ。

2層アーキテクチャ。多くの場合、正解は両方を使うことです。Flash-Liteをすべてのリクエストに対する安価な最初のパスとして使い、Qwen3.8-Maxを、百万トークン、画像、または本格的な推論を必要とするわずかな割合のリクエストのためのエスカレーションパスとして使います。このパターンは、Flash-Liteのコスト優位性の大部分を確保しつつ、最先端の選択肢も維持できます。

セルフホスティングと開放性

Flash-Liteはクローズドで、恒久的にAPI専用です。セルフホストする手段はありません。

Qwen3.8-Maxのウェイトは今週中の公開が約束されているが、フラッグシップは現実的な目標ではない。おおよそ4ビットで1.2TBという規模は、H200あたり約141GBと比較すると、最上位アクセラレータが8基以上必要になることを意味する。さらにAlibabaはアクティブパラメータ数をまだ開示しておらず、その投資で得られるスループットはモデル化できない。また、ライセンス条文もまだ存在しないため、商用利用の可否は正式には未確定である。

同時に発表されたQwen3.8-27Bは、オンプレミス計画にとって実際に重要なリリースです。また、オープンウェイトになり、およそ17GBのVRAMで動作すると報じられており、真のセルフホスティングオプションです。特筆すべきは、2.4TフラッグシップよりもFlash-Liteの効率性ニッチにはるかに近い競争相手であることです。

よくある質問

今日はQwen 3.8を使えますか?

はい。Qwen3.8-Max は 2026年8月3日に一般提供が開始され、公開価格は 1M トークンあたり $2 / $6、OpenAI および DashScope 互換のエンドポイントを備えています。Alibaba Model Studio、DashScope、OrcaRouter を通じてセルフサービスで利用できます。この記事の以前のバージョンではゲート付きプレビューについて説明していましたが、これは現在では古い情報です。

どちらの方が安いですか?

Gemini 3.5 Flash-Lite は{{1}}大差で{{/1}}優位:$0.30 / $2.50 {{2}}(Qwen3.8-Max の $2 / $6 と比較した 1M あたり){{/2}} — {{3}}入力は約 6.7 倍、出力は 2.4 倍安い{{/3}}。{{4}}大量のショートコンテキスト処理では、この差が他のすべての考慮事項を圧倒します{{/4}}。

どちらが良いですか?

それらは異なるティアです。Flash-Liteには唯一の監査済みスコア(AA Index 36)がありますが、推論ではなく安価なスループット向けに作られました。Qwen3.8-Maxはおそらくはるかに高性能です。自己申告のGPQA Diamond 92.6とTerminal-Bench 2.1 86.6はフロンティア級の水準ですが、独立したベンチマークがないため、それは測定結果ではなく推測に過ぎません。

どちらが速いですか?

Flash-Lite は、大幅に高速です。Artificial Analysis の計測では毎秒約490トークンで、これは効率層として設計された性能です。Qwen3.8-Max は、OrcaRouter の7日間テレメトリで p50 の最初のトークンまでの時間が1.64秒ですが、大規模で徹底的なモデルであり、プレビュー時期のレビュアーは長いエージェント型ビルドでは遅いと指摘していました。

Qwen 3.8は今オープンウェイトを公開していますか?

まだです。Alibabaは最先端のウェイトが週内に到着するとしていますが、ライセンス、モデルカード、リポジトリはまだありません。たとえリリースされたとしても、2.4TモデルにはH200クラスのGPUが8台以上必要です。同時に発表されたQwen3.8-27Bは、約17GBのVRAMと報告されており、現実的なセルフホスティングの選択肢です。

両方使うべきですか?

多くの場合、その通りです。2層構造 — すべてのリクエストに対して安価なファーストパスとしてFlash-Liteを使い、長文コンテキスト、マルチモーダル、または本当に難しいタスクのためのエスカレーションレーンとしてQwen3.8-Maxを使う — ことで、Flash-Liteのコスト優位性のほとんどを維持しつつ、その価格に見合う最先端のオプションも手に入れられます。

今日は本番用にどちらを選ぶべきですか?

Flash-Liteは、Index 36で十分な高容量・短コンテキスト・テキストのみの作業に適しています{{1}}—安価で高速、監査済み、実績があります{{/1}}。ワークロードが100万トークンのコンテキスト、画像・動画入力、またはFlash-Liteでは明らかに失敗する推論を必要とする場合は、Qwen3.8-Maxを使用します{{2}}{{/2}}。両方とも現在は実際にデプロイ可能です{{3}}—これは、この比較が最初に書かれた時点では当てはまりませんでした{{/3}}。

結論

Gemini 3.5 Flash-Lite vs Qwen 3.8これはかつて、製品と発表の比較でしたが、もはやそうではありません。2026年8月3日以降、Qwen3.8-Maxは一般提供され、価格が設定され、セルフサービスで利用でき、ドキュメントも整備されています。したがって、正直な捉え方としては、これは準備が整っているかの判断ではなく、ティアの選択です。

Flash-Liteは、設計された用途において依然として正しいデフォルトです。$0.30 / $2.50、約490トークン/秒という性能で、丸め誤差程度のコストで全リクエストを処理でき、監査済みのIndex 36は分類、ルーティング、抽出に完全に十分です。Qwen3.8-Maxはエスカレーションティアであり、100万トークンの定額コンテキスト、ネイティブの画像・動画入力、そして最先端の推論と謳われる性能を提供しますが、入力コストは約6.7倍です。唯一の未解決の弱点は以前と同じで、独立した評価機関によるスコアが存在しないため、品質の裏付けはAlibaba自身の発表データに依存しています。最初の独立系Intelligence Indexスコアと、Flash-Liteのニッチとより直接的に競合することになるQwen3.8-27Bのモデルウェイトに注目してください。それまでの間は、ワークロードの特性に応じて選択し、両方の実行を検討してください。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube