Um cartão hero gerado intitulado 'Dots vs Gemini 3.1 Pro'. Uma linha vertical o divide: o painel esquerdo, rotulado 'Dots', contém um ícone de computador na nuvem e a linha 'computador próprio + navegador - 4.000+ apps'; o painel direito, rotulado 'Gemini 3.1 Pro', contém um ícone de olho e forma de onda e 'texto, imagem, áudio, vídeo em - contexto de 1M - $2,00 / $12,00'. O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Dots vs Gemini 3.1 Pro: Um Agente com um Desktop Contra um Modelo com Cinco Sentidos

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

The word "multimodal" hides the real difference between these two, so start with what each one does with the world. Gemini 3.1 Pro Preview is Goog​le's flagship reasoning model, released in preview on February 19, 2026: it accepts text, images, audio, video and files as input and returns text, works across a 1,048,576-token context window with up to 65,536 tokens of output, and costs $2.00 per million input tokens and $12.00 per million output tokens below a 200,000-token prompt, repricing to $4.00 and $18.00 above it. Dots is the company's always-on agent, announced at DevDay on September 29, 2026: an agent with its own cloud computer and browser that works across more than 4,000 connected apps, runs on GPT-6 Astra, and comes included with Pro and Business Premium. Gemini 3.1 Pro watches the world and describes it; a dot acts inside it. Those are different verbs, and almost every practical question about this pair follows from which verb your problem needs.

Entrada não é o mesmo que ação.

O suporte de mídia do Gemini 3.1 Pro é genuinamente amplo — uma gravação de duas horas, uma foto de produto, uma exportação de planilha e um contrato podem todos chegar na mesma solicitação — mas cada uma dessas entradas é algo que já existia antes da chamada. A saída do modelo é texto: uma resposta, uma extração, um plano, um rascunho. Nada fora da conversa muda porque o modelo foi executado.

Um ponto inverte isso. As entradas dele são mundanas — suas mensagens, os dados do seu app, uma tarefa que você descreveu — e a saída dele é uma mudança no mundo: um arquivo movido, um ticket atualizado, uma mensagem enviada após sua aprovação, uma página aberta no próprio navegador dele. Os materiais de lançamento da OpenAI o descrevem levando vários projetos adiante ao mesmo tempo, aprendendo com o feedback e aceitando novas tarefas sem uma nova thread. Isso é a descrição de um trabalhador, não de um modelo, e explica por que a OpenAI não publicou nenhum benchmark para ele: você não avalia um colega num leaderboard, você observa o que ele consegue realizar e confere a Activity View.

• O que ele recebe — mensagens, descrições de tarefas e dados de aplicativos conectados de um lado; texto, imagem, áudio, vídeo e arquivo do outro

• O que ele produz — alterações dentro de outros softwares, sujeitas a regras e etapas de aprovação, em vez de texto que você mesmo manipula depois

• Onde ele roda — o computador em nuvem da OpenAI com navegador próprio, isolado da sua máquina a menos que você os conecte, em contraste com a infraestrutura de veiculação do Google, acessível por meio de uma API de qualquer lugar que você quiser

• Contexto — não documentado para um ponto, em comparação com 1.048.576 tokens de entrada e 65.536 tokens de saída

• Evidência — demonstrações de fornecedores, sem benchmark independente, em comparação com um Índice de Inteligência da Artificial Analysis de 29,7, com 94,1 no GPQA Diamond e 82 na recuperação de contexto longo, listado independentemente do Google

O que vale ter o Gemini 3.1 Pro

A razão para manter um modelo como este por perto é que a percepção é difícil e a maioria dos agentes é ruim nisso. O perfil independente publicado do Gemini 3.1 Pro é incomum: 94,1 no GPQA Diamond é um resultado quase de fronteira, 82 em recall de contexto longo é o segundo melhor número no conjunto de modelos que listamos, e 58,7 no SciCode o coloca no topo desse ranking específico. Onde ele não se destaca é na tomada de decisão agêntica — uma pontuação de 95,6 no τ²-Bench é respeitável, mas seu recorte τ-banking, aquele que mede o uso de ferramentas em várias etapas contra os sistemas de um banco, fica em 21,4. Todas essas são medições de terceiros listadas com sua fonte em nosso catálogo, não números do fornecedor, e é por isso que valem mais do que um deck de lançamento.

A outra metade dessa história por requisição é que o modelo não é gratuito. Ele entrou em prévia em fevereiro, meses antes de o atual modelo de fronteira ser lançado, e seu preço está acima da camada barata: US$ 2,00 e US$ 12,00 por milhão de tokens equivalem a cerca de US$ 0,0006 de entrada por página de texto denso, o que não é nada até você rodar uma ingestão de vídeo sobre uma biblioteca — e aí vira um item de custo. Ler um quadro de vídeo custa o mesmo que ler um parágrafo, e o modelo vai cobrar você pelos dois sem pestanejar.

A screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview, showing the identifier 'google/gemini-3.1-pro-preview' with Vision, Audio, Tools, JSON and Reasoning badges, a publication date of 2026-02-19, the description of it as Google's frontier reasoning model with improved software engineering and agentic reliability, a side panel showing 1M tokens of context and 65K maximum output over audio, file, image, text and video input, and a price strip reading $2.00 and $12.00. The page's own sidebar note records this as a headless screenshot of the live page.

Dois modelos de custo que se recusam a converter

O custo de um dot é uma assinatura com uma franquia não publicada: o primeiro está incluído no Pro ou Business Premium, limites estendidos se aplicam no primeiro mês, conversas com seu dot não consomem os limites de uso do ChatGPT, e não há preço publicado para um segundo dot, para velocidade ou capacidade extra, ou para uma tarefa concluída. O relato da CNBC sobre o keynote traz Sarah Friar precificando o novo nível Pro 500 de $500 como uma franquia de uso mais o modo Ultrafast, e não como uma tarifa por dot, de modo que o plano mais caro na tabela da OpenAI também não gera um custo por unidade de trabalho de agente.

O Gemini 3.1 Pro converte tudo em tokens, incluindo as partes que não são texto. Áudio, vídeo e imagens são faturados como entrada, pelo que o custo de uma tarefa depende de quanto do mundo fez o modelo observar — uma propriedade útil, porque é possível medi-la, e uma perigosa, porque o número mais elevado na fatura é muitas vezes aquele com que ninguém contava. O encaminhamento de modelos ajuda aqui de uma forma específica, e não genérica: com mais de 200 modelos por trás de uma única chave ao preço de tabela do fornecedor, sem qualquer margem, a leitura multimodal dispendiosa e o trabalho de seguimento mais barato podem residir em modelos diferentes no mesmo pipeline, e uma alteração de preços da Google chega à sua conta no próprio dia, em vez de na renovação.

A generated scoreboard titled 'Dots vs Gemini 3.1 Pro - inputs, outputs, evidence', with two columns. 'Dots' lists: Inputs messages and app data; Output changes inside connected apps; Model GPT-6 Astra (vendor-stated); Computer its own cloud computer and browser; Connectors 4,000+ apps; Independent benchmark none. 'Gemini 3.1 Pro' lists: Inputs text, image, audio, video, file; Output text only; Context 1,048,576 tokens; Max output 65,536 tokens; Price $2.00 in / $12.00 out per 1M below 200K; AA Intelligence Index 29.7. A footer reads 'Dots details vendor-stated from DevDay; Gemini 3.1 Pro figures from independent listings in the OrcaRouter catalogue.'

Onde os dois trabalham juntos

O par natural é um dot que coordena e um modelo multimodal que percebe. O trabalho chega, um dot o encaminha: qualquer coisa que precise ser vista ou ouvida vai para o Gemini 3.1 Pro para uma descrição estruturada, e a descrição volta para o fluxo de trabalho, onde um agendamento ou uma regra pode agir sobre ela. O dot trata do acompanhamento; o modelo trata da leitura. Dividir dessa forma também mantém as chamadas de modalidade caras auditáveis, o que importa porque são elas que surpreendem as pessoas.

O modelo é roteado como google/gemini-3.1-pro-previewao preço de tabela do provedor, repassado com 0% de margem, o resto do catálogo, com failover automático entre provedores upstream quando um degrada e uma DSL de roteamento para compor vários modelos em uma única chamada. It is worth being precise about what that does not include: dots are not on our catalogue, there is no endpoint for one, and no model identifier exists to point a request at. If you want the perception layer under your own control — and a preview model from February is exactly the kind of dependency worth containing — the model belongs behind your endpoint and the agent stays wherever you rented it.

De qual verbo o seu problema precisa?

Se o trabalho envolve olhar ou ouvir algo e produzir uma resposta, o Gemini 3.1 Pro é a ferramenta, e o dot é a compra errada. Se o trabalho envolve concluir algo em vários aplicativos sem você dirigir, o dot é a ferramenta, e nenhuma quantidade de entrada multimodal o substitui. As equipes que fazem isso direito rodam os dois e mantêm a fronteira explícita: percepção em um modelo tarifado por uso que você pode medir, ação por trás de um produto que você pode cancelar.

A screenshot of the OrcaRouter model catalogue page headed 'Models', showing the line '206 models - 16 providers - one API key, one bill' above filter controls for input modalities, context length, input price, status and supported parameters, with a grid of model cards and credit top-up offers visible beneath.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente