生成されたヒーロータイトルカードは「Gemini 3.1 Pro vs Qwen3.8-27B」と表示し、サブタイトルは「7か月前のプレビュー版 vs ダウンロードできるチェックポイント」で、2枚のカードを配置:Gemini 3.1 Pro は 2026年2月19日からプレビュー提供中、入力 $2.00/出力 $12.00(100万トークンあたり)、Artificial Analysis Intelligence Index は 29.7。対する Qwen3.8-27B は 2026年8月14日からオープンウェイトで公開、入力 $0.50/出力 $3.00(100万トークンあたり)、インデックスは 33.7。両者の間には VS メダリオン、右下には OrcaRouter のロゴ。フッター:「Artificial Analysis Intelligence Index v4.3.2、取得日 2026-09-23、価格はプロバイダーの定価です。」
Guides & Insights

Gemini 3.1 Pro vs Qwen3.8-27B:7か月先のプレビュー vs ダウンロードできるチェックポイント

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年9月18日、ベンダー自身のAI開発者フォーラムのユーザーが、Gemini 3.1 ProがAI Studioのモデルセレクターから消えたと報告し始めた。有料アカウントも例外ではなく、キャッシュを消してもシークレットウィンドウでも同じだった。「バグか、意図的なものか」をベンダーが明言するよう求めるスレッドは、9月21日時点でもまだ生きていた。非推奨の告知も、移行パスも、スタッフからの返信もない。一方でQwen3.8-27Bは、ラボが8月14日にApache 2.0の下でオープンソース化したもので、すでにダウンロードした人から取り上げることはできない。この非対称性——現実だが控えめなベンチマークの差ではなく——こそが、この対決が実際に問うている点であり、比較表が両者を並べて示していても、この2つのモデルが本当に同じ枠を争っているわけではない理由なのだ。

以下は、存在する数値に関する直接比較であり、それぞれにラベルを付けて示します。Artificial Analysisの数値は2026年9月23日に取得されたキャプチャに基づくもの、Alibaba自身のモデルカード、Googleのローンチ投稿、そして当社独自のルーティングテレメトリーで、これらは全体を通して区別して扱います。何も測定されていない箇所では、このページは推測するのではなく、その旨を明記します。

今週何が起きたのか、そしてそれが何を意味し、何を意味しないのか

報告は具体的で、競合他社のブログではなく Google 自身のフォーラムから出ている。「Gemini 3.1 Pro が 2026-09-18 以降 AI Studio から消えている——バグか、意図的なのか?」というタイトルのスレッドでは、有料ユーザーが何の告知もなくモデルを失っていること、Google One サポートが無関係なトラブルシューティング手順を提示していること、Google のステータスページには何も問題が表示されていないことが述べられている。2つ目のスレッド「Gemini 3.1 Pro Preview モデルが AI Studio でアプリを構築するために利用できない」でも同じ不満が集まっており、その中には、何か月もプレビュー版でコーディングアシスタントを構築してきたユーザーが、Flash は自分のコードベースでは「スロップを作る」と述べている例も含まれる。

正直なところ、ただし書きが3つある。これは開発者コンソールからの消失であり、API障害が確認されたわけではない。Gemini 3.1 Pro は当社自身のカタログには今も掲載されておりルーティング可能で、過去7日間で9,470万トークンを処理している。これはユーザーからの報告だ。Google は何も発言していないため、Google の外部にいる誰も「静かな非推奨」と「容量問題」と「コンソールのバグ」を切り分けられない。そして、このモデルがプレビューの状態に2026年2月19日からあることを考えれば、タイミングはお世辞にも良いとは言えない。7か月が経ち、GA の日付は公表されておらず、その間に Google はその下位に Flash モデルの階層を投入してきた。別件として、GitHub Copilot は2026年9月1日に Gemini 3.1 Pro を30日前の通知をもって廃止した。これは別個の無関係な出来事だが、指し示す方向は同じだ。GA へのコミットメントがないプレビューエンドポイントは、不安を覚えて当然の依存先なのだ。

私たちの側の一つの数値は、その文脈と並べて示す価値があります。説明できないので、むしろ正直にそう言っておきたいからです。Gemini 3.1 Pro のカタログ項目に関する当社の7日間テレメトリでは、エラー率80.5%を示しています。同じ朝に確認した隣接モデル — Qwen3.8-Max、Claude Fable 5.1 — は5.9%と6.9%です。それがフォーラムで報告されているのと同じ問題なのか、ある上流プロバイダーにとっての不調な一週間なのか、計測上のアーティファクトなのかは分かりません。コミットする前にカナリアを実行する理由として扱い、モデルに対する判定として扱わないでください。

同じ物差しで、二つの異なるスコア

ここはほとんどの比較ページが間違える部分なので、丁寧に扱う価値がある。Artificial AnalysisはこれらのモデルをどちらもIntelligence Index v4.3.2でスコア評価している。私たちは2026年9月23日に両方のページを取得し、両方とも同じリビジョンを示している——そのため、ほとんどのモデル横断的なインデックス主張とは異なり、これは同一スナップショットであり、その差は実在する。

• Qwen3.8-27B(xhigh) — インテリジェンス指数 33.7

• Gemini 3.1 Pro Preview — インテリジェンス指数 29.7

Qwenは現在のものさしでは4ポイント差でリードしている。より難しい問いは、それが何を意味するかだ。なぜなら、そのものさし自体が今年少なくとも3回動いているからである。2月に、Artificial AnalysisはGemini 3.1 Pro Previewを「AIの新たなリーダー」と呼ぶ記事を公開し、Claude Opus 4.6を4ポイント上回っていた。当時の報道は、当時Index v4.0だったものでスコア57を報じた。v4.3.2では29.7だ。Artificial Analysisは2026年9月7日、v4.2の4日後にv4.3を発表し、この改訂でTerminal-Bench 2.1がはるかに難しい66タスクのTerminal-Bench 4.0に差し替えられ、τ³-BankingがAutomationBench-AAに置き換えられた。Gemini 3.1 Proの2月の強みは、新しいインデックスが廃止または重み付けを変えた評価にあった。つまり、モデルが悪くなったのではなく、試験のほうが難しくなったのだ。しかし今日モデルを選ぶのであれば、実際に行動に移せるのは今日の数字であり、今日の数字はQwenに有利だ。

二つが本当に分岐するところ

集計スコアは差異の形を隠してしまうが、有用なのはその形のほうだ。以下のすべての図は、両モデルについて同一リビジョン上の Artificial Analysis の v4.3.2 ページを9月23日に取得した同じキャプチャによるものである。

• 推論と知識 — Geminiが明確にリード。GPQA Diamond 94.1 対 90.5、Humanity's Last Exam 47.0 対 33.9、SciCode 58.7 対 46.6、CritPt 17.7 対 5.4。

• 実世界の職業タスク — Qwenがリード、しかも大差で。GDPval正規化で45.4% 対 13.8%。

• エージェント型バンキングとトランザクション — Qwenが首位。τ-Banking 48.0 対 Geminiの21.4。

• 汎用ベンチマークにおけるエージェント型ツール使用 — Qwenが測定されていない領域ではGeminiが首位。Geminiのτ²-Benchは95.6、Qwen3.8-27Bの数値は存在しない。

• ターミナル作業 — 接戦だが、新しいベンチマークではどちらもひどい。Terminal-Bench 2.1:Qwen 79.8、Gemini 73.8。Terminal-Bench 4.0:Qwen 5.6%、Gemini 4.0% — どちらも一桁台。

• キャリブレーション — どちらのページでも最も際立つ乖離。AA-Omniscienceでは、Geminiは31.9で、正解率54.9%、ハルシネーション率50.9%を記録。Qwenは−10.0で、正解率15.6%、ハルシネーション率30.3%。Geminiはより多くを知り、半分以上の頻度ででっち上げる。Qwenは頻繁に回答を拒み、実際に回答するもののおよそ3分の1でハルシネーションを起こす。

• 長いコンテキスト — 長文コンテキストの想起では完全に互角で、どちらも82.0。マルチモーダル長文コンテキストの想起では、Qwen 21.7% 対 Gemini 15.6%。

「測定されていない」という項目は、そのままの意味で受け取るべきだ。Geminiには、Qwenの45.4%に対して公表されたGDPval-AA正規化数値がなく、Qwenには、Geminiの77.1、53.8、30.3に対してτ²-Bench、IFBench、Terminal-Bench Hard、ITBench-SREの数値がない。それらの空白の一つ一つは、要約表が密かに勝者を仕込んだであろう場所である。

A generated two-column scoreboard headed 'Gemini 3.1 Pro vs Qwen3.8-27B — the scoreboard', with the same six dimension labels in both columns. Gemini 3.1 Pro: AA Index 29.7, price per 1M $2.00 input and $12.00 output, context 1M tokens, output speed 116.5 tokens per second, open weights no (preview API), cost to run the index $1,310. Qwen3.8-27B: AA Index 33.7, price per 1M $0.50 input and $3.00 output, context 262K native, output speed 41.3 tokens per second, open weights yes (Apache 2.0), cost to run the index $1,336. Footer: 'Artificial Analysis Intelligence Index v4.3.2, captured 2026-09-23; prices are provider list rates.'

予算を左右する乖離:インデックスの運用コストは同じ

Qwen3.8-27Bはトークンあたりのコストが劇的に安い。Artificial Analysisが公開している市場データによると、100万入力トークンあたり$0.50、100万出力トークンあたり$3.00で、キャッシュ割引は80%、7:2:1の加重平均レートは$0.47だ。Gemini 3.1 Pro Previewは$2.00と$12.00——入力価格は4倍、出力価格も4倍——で、キャッシュ割引は90%、加重平均レートは$1.74である。

そして誰も公表しない数字:Artificial Analysis 自身の計算では、Intelligence Index 全体を実行するコストはGemini 3.1 Pro Preview で $1,310.21、Qwen3.8-27B で $1,335.92。Qwen のほうが安く動くわけではない。むしろごくわずかに高い。そこに到達するまでの時間が長いからだ。Qwen の出力請求のうち、$512.36 は推論トークンで、実際の回答は $82.51 だった。Gemini の場合は、$691.82 が推論で、回答は $113.08 だった。トークン単価は料率であり、請求額ではない。

比較表が省いてしまう価格の事実があと2つある。第一に、Gemini 3.1 Pro の価格はリクエストごとの入力サイズに応じた段階制で、200K 入力トークンまでは $2.00/$12.00、それを超えると $4.00/$18.00、キャッシュ読み取りは $0.20 から $0.40 へ倍増する。100万トークンのコンテキストウィンドウは実在するが、そのうち最後の80万トークンは倍のコストがかかる。第二に、当社のカタログにある Qwen3.8-27B の項目——block-FP8 で提供、vision tower はフル精度——では、入力 $0.40、出力 $4.21 と記載されており、上記の市場価格より入力は安く出力は高いうえ、キャッシュトークンの料金は一切公表していない。プロバイダーが違えば内訳も違う。実際に請求される料金を確認しよう。

両方のモデルは、1つのOrcaRouterキーを通じて、プロバイダー定価で0%のマークアップで利用できます。そのため、ベンダーの価格変更は再価格設定サイクルを経た後ではなく、同日に当社側へ反映されます。これは、2つのうち一方に200Kトークン地点のティア境界がある場合、通常以上に重要です。

レイテンシー:最速の最初のトークンは、より低速なモデルのものである

これは比較全体の中で最も誤解を招く一対の数字であり、読者が最も誤った行動を起こしやすい箇所でもある。

• 最初のチャンクまでの時間 — Qwen 4.04秒 vs Gemini 28.37秒。Qwenは7倍速く見える。

• 実際の回答までの時間 — Gemini 28.37秒 対 Qwen 52.52秒。Gemini が約1.8倍で勝っています。なぜなら Qwen は最初のチャンクと最初の回答トークンの間に48.48秒を思考に費やしているからです。

• 出力速度 — Gemini は毎秒116.5トークン、Qwen は毎秒41.3トークン。書き始めてからは Gemini が2.8倍速く、比較対象の中央値は Artificial Analysis によると毎秒95.4トークン。Qwen 自身のページも「著しく遅い」と述べている。

あなたのプロダクトがユーザーに最初のトークンをストリーミング配信するなら、Qwenの宣伝文句のレイテンシは、あなたが一度だけ自分に言い聞かせる嘘である。あなたのプロダクトが完全な回答を待つなら、Geminiのほうが高速なモデルだ。どちらの数値もArtificial Analysisの測定値であり、どちらもQwenのxhighエフォート設定で取得されたもので、これはモデルカードのデフォルトである。

そのデフォルト設定は実務者の間で今も続く不満であり、モデルカードもそれを半ば認めている。Qwen3.8-27Bはreasoning_effortパラメータを3つのレベルで公開している——xhigh(デフォルトで、「徹底的な分析を要する複雑なタスク向け」)、medium、そしてlow。9月までのコミュニティの記事は、xhighが非常に長い思考フェーズを生み出すと報告し、mediumまたはlowに下げ、推論バジェットに上限を設けることを勧めている。Alibaba自身のカードは、マルチターンのエージェント作業では、エフォートを下げても「必ずしもタスク完了までの総時間が短縮されるわけではない」と警告している——これはモデルカードとしては率直な記述であり、明白な修正策が常に修正策になるとは限らないという警告でもある。

コンテキスト: 1M 対 262K、そして実際に何が収まるのか

Gemini 3.1 Proは1,000,000トークンのコンテキストウィンドウを持ち、最大出力は65,536トークンです。Qwen3.8-27Bはネイティブで262,144トークンを搭載し、YaRNスケーリングにより1,000,000まで拡張可能で、その内部では別々の予算配分が推奨されています。推論コンテンツは最大262,144、最終応答は最大131,072です。

正直な脚注を2つ。Artificial Analysisの仕様表にはQwenのウィンドウが256,000と記載されている一方、同社のFAQテキストでは260K、モデルカードでは262,144とされている——これらは同じ数値の丸め方の違いにすぎないが、引用するなら262,144だ。モデルカードにそう書かれているのだから。そして1Mへの拡張はスケーリング手法であり、ネイティブの100万トークンウィンドウとは別物だ。YaRN拡張モデルにおける1Mでの長文脈リコールは、82.0というAA-LCRの数値が測っているものではない。Qwen3.8-27Bについて1Mコンテキストのリコールスコアを公表した者はいない。Geminiのウィンドウはフルレングスで挙動が実測されているものとして扱い、Qwenのウィンドウはそれを前提に設計する前に自分でテストすべきものとして扱え——そして、入力トークンが200Kを超えるとGeminiの価格が2倍になることを忘れるな。

エージェント的業務とツール呼び出し

ここは比較が本当に決着していない領域であり、でっち上げの勝者を選ぶのは簡単だが誤っている。Qwen3.8-27BにはGeminiにないエージェント性能の計測値があり、その逆もまた然りだ。

Qwenの主張は、強力な独立系の数値と、強力なベンダー系の数値に依拠している。独立系の数値は、銀行業務環境内での多段階ツール使用に関するベンチマークにおいて、同一リビジョンでτ-Bankingが48.0対Geminiの21.4——2倍以上だ。ベンダー系の数値はAlibaba自身のカードで、OSWorld-Verified 84.3、WebArena-Verified 64.8、AndroidWorld 81.9、CoWorkBench 70.7、JobBench 33.4、Agents' Last Exam 20.4 Pass@1を挙げている。これらはAlibabaの評価であり、他者による再実行はなく、独立に測定されたGDPval結果(正規化45.4%対13.8%)が同じ方向を指し示すカテゴリーにちょうど位置している。

Geminiの主張は、この比較において唯一高い絶対的なエージェント性能値——τ²-Bench 95.6——を持っているという点にあり、Qwenにはτ²-Benchのスコアがまったくない。また、指示追従のIFBench 77.1もあり、これもQwen側では空白だ。さらに、登場から5週間のオープンウェイト版にはない7か月の本番運用実績がある。

決め手はスコアではなく、あなたのトポロジーだ。Qwenのエージェント的優位性は、モデルが自ら設計したわけではない大規模で既存のソフトウェアシステムの内部で動作するベンチマークで測られる。Geminiのそれは、モデルが長時間にわたって指示を正確に守らなければならないベンチマークで測られる。これらは異なるスキルであり、どちらも本物だ。

A screenshot of the Artificial Analysis comparison page for Gemini 3.1 Pro Preview against Qwen3.8-27B, showing an Intelligence Index of 29.7 for Gemini 3.1 Pro Preview and 33.7 for Qwen3.8-27B on revision v4.3.2, with blended price rows of $1.74 and $0.47 per 1M tokens, cost per task of $1.01 and $0.67, cost to run the full Intelligence Index of $1,310 and $1,336, and the output-token breakdown beneath.

コーディング

コーディングも同じように分かれる。だからこそ、ここでは「コードではどちらが優れているか」に明快な答えはない。Geminiは科学技術計算寄りの領域をリードしている——SciCode 58.7 対 46.6——そして当社のカタログページにあるそのAA Coding Index 68.8は、Qwenの68.1とは丸め誤差の範囲内であり、引用に値するどの信頼区間にも十分収まっている。エージェント型ターミナル作業では、古いベンチマークでは両者は近く、Terminal-Bench 2.1ではQwen 79.8 対 Gemini 73.8であり、新しい方では区別がつかず、どちらも1桁台に落ち込む。

Alibabaのモデルカードはさらに多くを主張している——SWE-bench Pro 61.7、LiveCodeBench v6 90.3、QwenSWEBench 79.0——だが、それらはベンダー報告であり、モデルカードの脚注には、SWE-bench ProとQwenSWEBenchはClaude Codeハーネスで実行されたと記されている。これは競合の数値が使ったであろうハーネスではない。安全に言えるのは、第三者が両研究所のモデルを測定した唯一のコーディングベンチマークにおいて、両者はTerminal-Bench 2.1では4ポイント、Terminal-Bench 4.0では1.6ポイント差があり、どちらもより難しい方では成績が良くないということだ。

オープンウェイト対プレビューエンドポイント

これは両者がまったく比較できない軸であり、実務上最も大きな影響を及ぼす軸でもある。

Qwen3.8-27BはApache 2.0で、27Bのdenseパラメータ、64層を持ち、Gated DeltaNet線形アテンションとフルアテンションを約3:1の比率で組み合わせたハイブリッドを採用している——262Kウィンドウを手頃に提供できるようにする設計だ。動作する。4ビットに量子化すると約17GBに収まり、これはコンシューマー向けGPU1台分だ。5週間のうちに、UnslothのDynamic V3量子化——Unslothによれば元の精度の約77%で8GBで動作する1ビットビルドを含む——から、9月中旬のPrismMLのTernary Bonsai 2 27Bまで、その周辺に圧縮エコシステム全体が育った。ファインチューニングもでき、監査もでき、ネットワークを抜いたラップトップでも実行できる。

Gemini 3.1 Proは、登場から7か月たつクローズドなプレビューエンドポイントで、GA日はなく、モデルカードにはプレビュー版が安定版ほどの安定性、可用性、サポートを欠く可能性があると明示的に警告されており、さらに今週時点では、どうやらひっそりと去ったらしい開発者コンソールまである。ダウンロードもできず、バージョンを固定することもできず、自分自身にフェイルオーバーすることもできない。

判定ではなく正直なルーティングの答えが欲しいなら、Gemini依存を生き延び可能にするのはオープンチェックポイントの存在だ。Qwen3.8-27Bをフォールバックとしてローカルまたはセルフホストの経路の背後に置き、測定可能なほど得意な推論負荷の高い作業ではGemini 3.1 Proをプライマリ経路に残し、その両方を自動フェイルオーバー付きの単一エンドポイントの背後に置く。そうすれば、誰か他人のコンソールから静かに消えることは、ユーザーに見える停止ではなく、あなたのルーティング層が吸収するインシデントになる。これは製品の売り込みではない — 今週のニュースがあなたの週末を奪わない唯一の構成だ。

Gemini 3.1 Proを選択する場合

• あなたにとって最も難しい仕事は、長期的なツール利用ではなく知識集約型の推論です — それは GPQA Diamond で 94.1 対 90.5、Humanity's Last Exam で 47.0 対 33.9、SciCode で 58.7 対 46.6、CritPt で 17.7 対 5.4 とリードしています。

• 本当に長い入力が必要だ。実測された100万トークンのウィンドウは、長大な文脈で想起挙動を検証済みであり、技術で拡張した262Kのウィンドウを上回る——200K入力トークンを超えると価格が2倍になることを許容できるなら。

• 回答が完了するまでの時間は、最初のトークンが生成されるまでの時間よりも重要であり、41.3ではなく毎秒116.5トークンが必要です。

• 今日は幅広いマルチモーダリティが必要です。音声、ファイル、画像、テキスト、動画の入力に対し、Qwenはテキスト、画像、動画に対応します。

• プレビューのリスクを受け入れる用意があり、自分で制御できるフォールバックがある。

Qwen3.8-27Bを選ぶ場合は

• あなたのエージェントは大規模な既存システムの内部で動作します — τ-Banking の 48.0 から 21.4、および GDPval の正規化値 45.4% から 13.8% は、この比較全体の中で、単一モデルによる最大の優位性のうちの2つです。

• 回答に必要なのは、自信ではなく正直さだ。Geminiの50.9%に対して30.3%というハルシネーション率は、別種の製品である。

• ライセンスまたはデータレジデンシーの規則によりクローズドAPIが使えない場合、あるいは自社データでファインチューニングする必要がある場合。

• Geminiの4分の1のトークン単価の請求を望み、その差額を思考トークンに費やすことを受け入れる——インデックスはどちらで実行しても同じコストがかかる。

reasoning_effortxhighのデフォルトのまま出すのではなく、下げる準備ができている。

私たちが検証できなかったこと

記録のために、そして比較ページは空白によってその良し悪しが決まるものだから:Qwen3.8-27Bについて、推論努力を低減した設定での独立した評価は公開されていない。したがって、mediumおよびlowにおける速度対品質のトレードオフは測定されていない。YaRN拡張1M構成についての長文脈リコールスコアは存在しない。Gemini 3.1 Proには公開されたGDPval-AA正規化スコアがなく、Qwen3.8-27Bにはτ²-Bench、IFBench、ITBench-SREのいずれについても存在しない。そして、Googleを含め、Gemini 3.1 Proが9月18日にAI Studioのセレクターから消えた理由を述べた者はいない。これらのいずれかが変わった時点で、このページを更新する。

A screenshot of the OrcaRouter model page for Qwen3.8 27B (obsidian/qwen3.8-27b), showing Vision, Tools, JSON and Reasoning badges, a 2026-08-15 catalogue date, a 262K-token context window, list pricing of $0.40 input and $4.21 output per 1M tokens with no cached-token rate published, a p50 time to first token of 3.92s and a p95 of 10.00s over seven days, 1023.1M tokens of traffic in the same window, and a description noting the model is served in block-FP8 with the vision tower kept at full precision.

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新