
Dots vs Gemini 3.1 Pro:デスクトップを持つエージェント 対 五感を備えたモデル
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 349 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 210 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- xAISpaceXAI: Grok 4.62026-08-1244知能77コーディング
The word "multimodal" hides the real difference between these two, so start with what each one does with the world. Gemini 3.1 Pro Preview is Google's flagship reasoning model, released in preview on February 19, 2026: it accepts text, images, audio, video and files as input and returns text, works across a 1,048,576-token context window with up to 65,536 tokens of output, and costs $2.00 per million input tokens and $12.00 per million output tokens below a 200,000-token prompt, repricing to $4.00 and $18.00 above it. Dots is the company's always-on agent, announced at DevDay on September 29, 2026: an agent with its own cloud computer and browser that works across more than 4,000 connected apps, runs on GPT-6 Astra, and comes included with Pro and Business Premium. Gemini 3.1 Pro watches the world and describes it; a dot acts inside it. Those are different verbs, and almost every practical question about this pair follows from which verb your problem needs.
入力は行動と同じではない
Gemini 3.1 Proのメディア対応は本当に幅広い——2時間の録音、製品写真、スプレッドシートのエクスポート、契約書が、すべて同じリクエストで届くこともある——しかし、それらの入力はいずれも、呼び出しの前からすでに存在していたものだ。モデルの出力はテキストだ。回答、抽出結果、計画、下書き。モデルが実行されたからといって、会話の外側で変わるものは何もない。
Dotはそれを逆転させる。その入力はありふれたものだ — あなたのメッセージ、アプリのデータ、あなたが説明したタスク — そしてその出力は世界の変化である:ファイルが移動され、チケットが更新され、あなたの承認後にメッセージが送信され、それ自身のブラウザでページが開かれる。OpenAIの発表資料は、それが同時に複数のプロジェクトを進め、フィードバックから学習し、新しいスレッドなしで新しいタスクを受け入れると説明している。それはモデルではなく、労働者の説明であり、OpenAIがそれに関するベンチマークを公表しなかった理由を説明している:あなたは同僚をリーダーボードでベンチマークするのではなく、それが何を成し遂げたかを見て、Activity Viewを確認するのだ。
• 受け取る入力 — 一方にメッセージ、タスクの説明、連携アプリのデータ、もう一方にテキスト、画像、音声、動画、ファイル
• それが生み出すもの — 他のソフトウェア内での変更。ルールと承認ゲートに従い、あなたがその後自分で扱うテキストに対して行われます
• 実行場所 — OpenAI のクラウドコンピュータ。独自のブラウザを備え、両者をリンクしない限りあなたのマシンからは分離されている。一方、Google のサービングインフラは、API 経由で好きな場所からどこからでもアクセスできる
• コンテキスト — ドットは未記載、入力1,048,576トークン・出力65,536トークンに対して
• 根拠 — ベンダーのデモ、独立したベンチマークなし、Artificial Analysis Intelligence Index の 29.7 に対して GPQA Diamond で 94.1、長文脈想起で 82、Google とは独立して掲載
Gemini 3.1 Proの何が持つ価値があるのか
このようなモデルを手元に置いておく理由は、知覚が難しく、ほとんどのエージェントがそれを苦手としているからだ。Gemini 3.1 Pro の公開された独立系プロファイルは異例である。GPQA Diamond での 94.1 はフロンティアに近い結果であり、長文脈リコールでの 82 は、我々がリストするモデル群の中で 2 番目に良い数値であり、SciCode での 58.7 はその特定のボードで首位に押し上げる。それが輝かないのはエージェント的意思決定である。τ²-Bench のスコア 95.6 は立派だが、銀行のシステムに対して多段階のツール使用を測定する τ-banking スライスは 21.4 にとどまる。これらはすべて、我々のカタログで出典とともに記載された第三者による測定値であり、ベンダーの数値ではない。だからこそ、発表資料よりも価値があるのだ。
そのリクエストごとの話のもう半分は、モデルが無料ではないということだ。それは2月にプレビュー入りし、現在のフロンティアが出荷される数か月前だった。そして、安価なティアより高い価格設定になっている。100万トークンあたり$2.00と$12.00は、高密度テキスト1ページあたり入力約$0.0006に相当し、ライブラリ全体に対して動画取り込みを実行するまでは何でもないが、そうなると明細項目になる。動画の1フレームを読むコストは段落を読むのと同じで、モデルはどちらも喜んで課金する。

変換しようとしない2つのコストモデル
dotのコストは、非公開の利用枠を伴うサブスクリプションだ。最初の1つはProまたはBusiness Premiumに含まれ、最初の月には拡張された上限が適用され、あなたのdotとの会話はChatGPTの利用上限を消費せず、2つ目のdot、追加の速度や容量、完了したタスクに対する公表価格は存在しない。CNBCの基調講演に関する報道では、Sarah Friarが新しい500ドルのPro 500ティアを、dot単位の料金ではなく、利用枠とUltrafastモードとして価格設定している。そのため、OpenAIの価格表で最も高価なプランも、エージェント作業の単位あたりのコストを生み出さない。
Gemini 3.1 Proは、テキストではない部分も含め、あらゆるものをトークンに変換します。音声、動画、画像は入力として課金されるため、タスクのコストは、モデルに世界のどれだけを見せたかによって決まります。これは便利な性質です。測定できるからです。そして危険な性質でもあります。請求額の中で最大の数字は、しばしば誰も想定していなかったものだからです。モデルルーティングは、ここで汎用的ではなく具体的な形で役立ちます。プロバイダー表示価格のまま、マークアップなしで200以上のモデルを1つのキーの背後に置けるため、高コストなマルチモーダル読み取りと安価な後続作業を、同じパイプライン内の別々のモデルに担当させることができ、Googleによる料金改定も、更新時ではなくその日のうちにあなたのアカウントに反映されます。

二つが連携する場所
自然な組み合わせは、調整を担う dot と、知覚するマルチモーダルモデルだ。仕事が届くと、dot がそれを振り分ける。目で見たり耳で聞いたりする必要があるものは、構造化された記述を得るために Gemini 3.1 Pro に送られ、その記述はワークフローに戻り、そこでスケジュールやルールがそれに基づいて動ける。dot が追跡を担い、モデルが読み取りを担う。そう分けることで、高コストなモダリティ呼び出しの監査可能性も保たれる。これは重要なことだ。なぜなら、人々を驚かせるのはまさにそれらだからだ。
OrcaRouter では、このモデルは google/gemini-3.1-pro-preview として、カタログの残りのモデルと並んで、0% のマークアップで定価のままルーティングされており、上流プロバイダーが劣化した際のプロバイダー間での自動フェイルオーバーと、複数のモデルを単一の呼び出しにまとめるためのルーティング DSLを備えています。含まれないものについて正確に述べておく価値があります。dots は当社のカタログにはなく、そのためのエンドポイントも存在せず、リクエストを向ける先となるモデル識別子も存在しません。知覚レイヤーを自分自身の管理下に置きたいのであれば——そして 2 月のプレビューモデルはまさに封じ込めておく価値のある類の依存関係ですが——そのモデルはあなた自身のエンドポイントの背後に置くべきであり、エージェントはあなたがレンタルした場所に留まります。
あなたの問題にはどの動詞が必要ですか
何かを見たり聞いたりして答えを出す作業なら、Gemini 3.1 Pro が使うべきツールであり、dot は誤った購入だ。あなたが自ら操作することなく複数のアプリケーションをまたいで何かを完了させる作業なら、dot が使うべきツールであり、どれだけマルチモーダル入力があってもその代わりにはならない。これを正しく実践しているチームは両方を運用し、境界を明示的に保っている。知覚は測定できる従量制モデル上で、行動は解約できる製品の背後で行う。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
