
Reflection Beam vs Gemini 3.1 Pro Preview:一方は動画を読み、もう一方はテキストを読む
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 150 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
この対決のどのベンチマーク表も触れていない非対称性から始めよう。Reflection Beamは、2026年10月5日に発表された5,010億パラメータのスパースなMixture-of-Expertsモデルで、トークンあたり230億パラメータがアクティブになり、テキストを入力として受け取り、テキストを出力する。それだけだ。Gemini 3.1 Pro Previewは、2026年2月19日以降、ベンダーのフロンティアなマルチモーダルモデルであり、テキスト、画像、動画、音声、ファイルを受け付け、この比較の中で「自分が尋ねたいものを見ることができるか」という問いに対する答えが両者で異なる唯一のモデルだ。それ以外のすべて——スパース率、コンテキストウィンドウ、価格帯——は議論の対象にすぎない。それだけは仕様なのだ。
つまりこれは、このセットの中で最も非対称な組み合わせであり、同時に最も有用でもある。モデル比較が実際に何のためにあるのかを、これが端的に表しているからだ。ワークロードがテキストなら、Beam と Gemini 3.1 Pro は、安価で未評価のものから高価で徹底的にスコアリングされたものまで続くスペクトル上の2つの選択肢だ。ワークロードに動画のフレームが含まれるなら、比較する余地はない。
各モデルの説明
Gemini 3.1 Pro PreviewはGoogleのプレビュー階層のフラッグシップです。コンテキストは1,048,576トークン、最大出力は65,536トークン、5つの入力モダリティを備え、100万トークンのウィンドウは一律料金ではなく段階的な価格設定によって実現されています。Googleはこれを、ソフトウェアエンジニアリングの強化、エージェント機能の信頼性向上、複雑なワークフローにおけるより効率的なトークン使用のために位置づけています。オープンウェイトではありません。その名前には依然として「Preview」が付いており、これはGoogleがこのモデルについて2月以来維持しているステータスです。
Reflection BeamはReflectionの最初のモデルであり、オープンウェイトシリーズの始まりです。総パラメータ数は5,010億、アクティブは230億 — トークンあたりモデルの約4.6%が稼働します。23.8兆の事前学習トークンを6,144枚のGB300チップで4週間未満で処理し、その後、約100万の環境で1億回を超えるロールアウトを用いた4週間にわたる強化学習キャンペーンを10,500枚のGB300チップで実施しました。APIはOpenAI互換で、api.reflection.ai/openai/v1 で Chat Completions と Models 一覧を提供し、コンテキストは256,000トークンでベータ版の脚注が付き、reasoning_effortパラメータには5段階があり、オフスイッチはありません。そして、その重みは今月中に Apache 2.0 で公開すると約束されています。
• モダリティ — Gemini 3.1 Pro Preview はテキスト、画像、動画、音声、ファイルを扱えます。Reflection Beam はテキストのみです。
• コンテキストと出力 — Gemini は入力 1,048,576 トークン、出力 65,536 トークンで、Beam は入力 256,000 トークン、出力 128,000 トークンです。
• 価格 — Gemini 3.1 Pro Preview は、200,000トークンまで100万トークンあたり入力$2.00、出力$12.00で、それを超えると$4.00と$18.00に上がり、キャッシュ読み取りは$0.20です。Reflection Beam は価格を公表していません。
• ツーリング面 — Google側ではネイティブなツール呼び出し、構造化出力、検索グラウンディング。Beam側ではツール呼び出しと構造化出力、Chat Completions に限定されたオプション。
• 重み — Gemini はプロプライエタリ、Beam は Apache 2.0 が約束されているが、まだリリースされていない。
• 独立系スコア — Gemini 3.1 Pro Preview には Artificial Analysis のインデックスがあるが、Beam はボード上に行がない。
モダリティギャップこそが議論のすべてだ。
{{1}}マルチモーダル{{/1}}と漠然と言及するよりも、具体的に語る価値がある。なぜなら、実際の結果は具体的だからだ。
画面録画、製品写真、スキャンした契約書、またはコールセンターの音声ファイルを取り込むワークロードは、どの価格であっても、どのプロンプトを使っても、どのプランでも、Beam では処理できません。API レイヤーでの回避策はありません。Beam のドキュメントには 1 つの入力モダリティと 1 つの出力モダリティしか記載されておらず、画像や音声の経路は一切記載されていません。Gemini 3.1 Pro Preview はその 5 つすべてを処理できるため、入力がすでにテキストではないワークフローにそのまま導入できる唯一のモデルはこれです。
逆のケースについても述べておく価値がある。それは人が間違えやすいケースだからだ。入力がテキストであり、テキストのままであるなら、Geminiの5つのモダリティは何の役にも立たず、テキスト処理を動かすためにマルチモーダルモデルの価格を払うことになる。これはBeamを支持する論拠ではない。モダリティの問いはベンチマークの問いより先に答えるべきだという論拠だ。なぜなら、それはどのスコア比較よりも安く、より確実に選択肢を排除するからである。
2つのプレビュー、2つの異なる意味
どちらのモデル名にもただし書きが付いており、しかもそのただし書きは似ても似つかない。これがこの組み合わせについて最も興味深い点だ。
Gemini 3.1 Proの「Preview」は、2月以降一般に呼び出し可能なモデルに付けられた命名慣習であり、独立したスコア、文書化されたロングコンテキスト枠を含む公開料金表、そして完全なツール群を備えている。実際のところ、ここでの「preview」はGoogleがそれを置き換える権利を留保しているという意味であり、入手が難しいとかスコアが未評価であるという意味ではない。
Beamのベータ版は真の関門だ。アクセスはウェイトリスト制で、モデルIDは2026年10月5日に作成され、料金表も第三者スコアも存在せず、中心的な主張を誰でも検証できるようにする成果物——重み、技術報告書、モデルカード——は提供済みではなく約束されているだけだ。コンテキストの数値にはベータ期間中に変更される可能性があるとの脚注が付いており、これは一般提供されているモデルには不要なヘッジである。
結果は、調達にとって重要な形で非対称だ。Gemini 3.1 Pro Preview を採用するチームは、モデル・チャーンのリスクを受け入れることになる。今日 Beam を採用するチームは、不明な価格、不明な独立系スコア、そしてモデルを自ら実行できないことを受け入れることになる。これらは異なるカテゴリーのリスクであり、最も頻繁に決め手となるのは価格だ。

ベンチマークと引用の問題
Reflection のローンチ時の表には、Gemini 3.1 Pro Preview も Google のモデルも含まれていません。その比較対象はオープンおよびセミオープンのみで、Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen 3.8-Max、DeepSeek V4.1 Flash です。したがって、この2つのモデルが公開された表で互いに比較されたことは一度もなく、以下の数値は双方で異なるハーネスから得られたものです。
• Artificial Analysis Intelligence Index — Gemini 3.1 Pro Preview は 29.7 を記録し、その実行では 147 中 58 位。Beam にはインデックスの行がまったくありません。
• GPQA Diamond — Artificial AnalysisによるとGemini 3.1 Pro Previewは94.1で、Beamのベンダー報告値90.5との対比。
• SciCode — Beamのベンダー報告値49.7に対し、Geminiは58.7。
• Humanity's Last Exam — Gemini が 47.0、ベンダー報告による Beam の 36.2 に対して。後者は明示的にツールなし。
• Terminal-Bench v2.1 — Artificial AnalysisによるGeminiの73.8に対し、Beamのベンダー報告値は80.1。これはこの対決においてBeamの最も強い項目であり、2月から市場に出ているモデルからの収穫である。
• 長文コンテキスト想起 — AA-LCRにおいてGeminiが82.0、Beamのベンダー報告値79.3に対して。
• tau-squared Bench — MCP AtlasではGeminiが95.6、Beamが78.7、tau3 bankingでは38.0。エージェント型ツール使用に関する関連する評価であり、同一のものではなく、名称の違いは重要だ。
この表のGemini側には、独自の一文を割く価値のある、別種の誠実性の問題がある。Gemini 3.1 Pro Previewの独立した指数スコアは、情報源によって30、46、47.7、57と引用されており、Artificial Analysisは同じ時点でもモデルページごとに異なる指数リビジョンを提供している。上の29.7という数値は、2026年10月6日に我々が読んだページにあるもので、我々が引用する唯一の数値だ。しかし、どのスナップショットから来たのかを言わずに、単一のGemini指数の数値を競合他社の隣に並べる記事は、変動する数値を固定されたものとして提示していることになる。同じ注意は、逆の形でBeamにも当てはまる。そこではスナップショットがまったく存在しない。
価格、そして誰も想定していないティア
Gemini 3.1 Pro Previewは、200,000トークンまでなら100万トークンあたり入力$2.00、出力$12.00で、それを超えると$4.00と$18.00です。キャッシュ読み取りは100万トークンあたり$0.20、キャッシュ書き込みは$0.375です。料金ティアの境界は、計画を立てる際に考慮すべき部分です。このモデルの目玉となる売りは1,048,576トークンのウィンドウであり、リクエストが200,000トークンを超えた瞬間、入力料金は2倍になり、出力料金は5割増しになります。したがって、100万トークンのウィンドウを前提に設計されたワークロードは、そのトラフィックの大半が第1ティアではなく第2ティアで価格設定されるワークロードです。
Beamには料金表がないため、モデル化すべき階層もなく、比較対象もない。この不在は中立ではない。つまり、Beamのコストについて最も擁護可能な記述は「不明である」ということであり、その効率性ポジショニングを定量的に裏付ける唯一の根拠はReflection自身のチャートだ。これは生成FLOPsを、アクティブパラメータ数の2倍に、DeepSWE、HLE、Terminal-Bench 2.1にわたる試行あたりの平均生成トークン数を掛けたものとして推定している——ただしキャプションでは、プロンプトのプリフィル、アテンション、サービングのオーバーヘッドが除外されていると認めている。100万トークンのコンテキストが重要となるワークロードでは、プリフィルは丸め誤差ではなく、まさにこの式が省いている項なのである。

ツールの使用、検索、そして2つの設計が異なる点
Gemini 3.1 Pro Preview がうたう強みは、ソフトウェアエンジニアリング、エージェント的信頼性、トークン効率であり、公開されているツールサーフェスには、関数呼び出し、構造化出力、検索グラウンディングが含まれている。エージェントスタックを比較する人にとって注目すべきは最後の項目だ。グラウンディング検索は Google 側のファーストパーティ機能であり、外部の検索サービスを組み込まなくても、ツール利用エージェントにできることを変える。
Beamのツールに関する話は、仕様の一行が示唆するよりも興味深く、評価するのはより難しい。Reflectionは、MCP Atlasが78.7、AutomationBenchの公開版が37.0、tau3 bankingが38.0、コンテキスト管理ありのBrowseCompが77.4、コンテキスト管理ありのDeepSearchQAが80.1だと報告し、さらに、強化学習中に、このモデルはウェブアクセスを与えられると、他の言語モデルに問い合わせたりOCR APIを呼び出したりすることを自然に学習したと指摘している — 学習データの混合にブラウジングタスクが含まれていなかったにもかかわらず。その一般化が成り立つなら、それはエージェント的転移に関する本物のシグナルだ。また現時点では、独立した検証のない、ある学習実行からのベンダーによる観察でもある。
ツール使用の行では、双方に数値がある場合、状況は一方的ではなく混在している。Beamのベンダー表では、MCP AtlasでGLM 5.2を上回り、tau3 bankingではGLM 5.2およびKimi K3と同等とされている。一方、Geminiのtau-squared Benchの数値95.6は、双方が公表したエージェント系の数値の中で最も高い。異なるスイート、異なるハーネスであり、共通の評価は存在しない——これがこの比較における繰り返し現れる問題である。
選択とヘッジの方法
上記から導かれる決定ルールは、一行で言えるほど単純だ。入力のいずれかがテキストでなければ、Beam は選択肢ではなく、比較はそこで終わる。すべての入力がテキストであれば、問いはこうなる――Beam の帰属先不明の効率性主張は、未知の価格と独立したスコアがないことの代償に見合うのか、文書化された階梯と完全なツール面を備え、$2.00 と $12.00 の費用がかかるモデルと対比してどうなのか。
Gemini 3.1 Pro Previewが当社のカタログに登場しました。プロバイダーのリスト料金をそのまま反映し、上乗せは一切ありません。api.orcarouter.ai/v1にあるOpenAI互換の単一キーの背後で、ほか200以上のモデルと並んで利用でき、同じキーでBeamが価格で競合するモデルも使えます。GLM 5.3の$1.26と$3.96から、DeepSeek V4.1 Flashの$0.15と$0.60まで、今朝ライブで取得した数値です。200,000トークンというティアの境界はモデルの問題ではなくルーティングの問題なので、ルーティングDSLでそれを直接表現できます。短いリクエストは安価なティアに留め、本当に長いリクエストは、ウィンドウサイズこそがそのモデルを選んだ理由である側に固定する——アプリケーションコードではなく、1回の呼び出しで。
Reflection Beam は当社の提供ルートの一つではなく、それを保有していると主張する相手を紹介することもありません。Apache 2.0 の重みが今月約束どおりに届けば、セルフホスティングがテキスト専用作業の第三の選択肢となり、効率性のうたい文句をご自身のハードウェアで検証できるようになります。

何が答えを変えるだろうか
BeamのGeminiに対する主張は、Beamのあらゆる比較が依拠するのと同じ2つの項目に基づいており、この対決ではさらに3つ目が加わる。
価格。それがなければ、効率性の主張を予算決定に変換することはできず、モデルは料金表ではなく図で競っていることになる。
独立したスコア。Artificial Analysisは10月5日、Reflectionがアクセスを提供し、同社がBeamをベンチマークしていると述べ、初期の指標は、Beamがその知能レベルにおいて同社がこれまでに見た中で最もトークン効率の高いオープンモデルの1つになることを示唆していると説明した。それは、正しい情報源が正しいことを言っているということだ。それでも、ボード上には依然としてBeamの行がない — モデルページは404を返し、今朝時点でリーダーボードにBeamのエントリは載っていない。
そして変わらないこと:Beamはテキスト専用だ。重みの公開も、値下げも、インデックススコアもそれを変えることはない。つまり、ある種のワークロード群にとって、この比較は決して比較にすらならないということだ。あなたのパイプラインに動画が含まれているなら、最初のベンチマークが読み込まれる前から、答えはGemini 3.1 Pro Previewだった。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
