
Dots vs Gemini 3.1 Pro: Um Agente com um Desktop Contra um Modelo com Cinco Sentidos
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 349 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 210 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
The word "multimodal" hides the real difference between these two, so start with what each one does with the world. Gemini 3.1 Pro Preview is Google's flagship reasoning model, released in preview on February 19, 2026: it accepts text, images, audio, video and files as input and returns text, works across a 1,048,576-token context window with up to 65,536 tokens of output, and costs $2.00 per million input tokens and $12.00 per million output tokens below a 200,000-token prompt, repricing to $4.00 and $18.00 above it. Dots is the company's always-on agent, announced at DevDay on September 29, 2026: an agent with its own cloud computer and browser that works across more than 4,000 connected apps, runs on GPT-6 Astra, and comes included with Pro and Business Premium. Gemini 3.1 Pro watches the world and describes it; a dot acts inside it. Those are different verbs, and almost every practical question about this pair follows from which verb your problem needs.
Entrada não é o mesmo que ação.
O suporte de mídia do Gemini 3.1 Pro é genuinamente amplo — uma gravação de duas horas, uma foto de produto, uma exportação de planilha e um contrato podem todos chegar na mesma solicitação — mas cada uma dessas entradas é algo que já existia antes da chamada. A saída do modelo é texto: uma resposta, uma extração, um plano, um rascunho. Nada fora da conversa muda porque o modelo foi executado.
Um ponto inverte isso. As entradas dele são mundanas — suas mensagens, os dados do seu app, uma tarefa que você descreveu — e a saída dele é uma mudança no mundo: um arquivo movido, um ticket atualizado, uma mensagem enviada após sua aprovação, uma página aberta no próprio navegador dele. Os materiais de lançamento da OpenAI o descrevem levando vários projetos adiante ao mesmo tempo, aprendendo com o feedback e aceitando novas tarefas sem uma nova thread. Isso é a descrição de um trabalhador, não de um modelo, e explica por que a OpenAI não publicou nenhum benchmark para ele: você não avalia um colega num leaderboard, você observa o que ele consegue realizar e confere a Activity View.
• O que ele recebe — mensagens, descrições de tarefas e dados de aplicativos conectados de um lado; texto, imagem, áudio, vídeo e arquivo do outro
• O que ele produz — alterações dentro de outros softwares, sujeitas a regras e etapas de aprovação, em vez de texto que você mesmo manipula depois
• Onde ele roda — o computador em nuvem da OpenAI com navegador próprio, isolado da sua máquina a menos que você os conecte, em contraste com a infraestrutura de veiculação do Google, acessível por meio de uma API de qualquer lugar que você quiser
• Contexto — não documentado para um ponto, em comparação com 1.048.576 tokens de entrada e 65.536 tokens de saída
• Evidência — demonstrações de fornecedores, sem benchmark independente, em comparação com um Índice de Inteligência da Artificial Analysis de 29,7, com 94,1 no GPQA Diamond e 82 na recuperação de contexto longo, listado independentemente do Google
O que vale ter o Gemini 3.1 Pro
A razão para manter um modelo como este por perto é que a percepção é difícil e a maioria dos agentes é ruim nisso. O perfil independente publicado do Gemini 3.1 Pro é incomum: 94,1 no GPQA Diamond é um resultado quase de fronteira, 82 em recall de contexto longo é o segundo melhor número no conjunto de modelos que listamos, e 58,7 no SciCode o coloca no topo desse ranking específico. Onde ele não se destaca é na tomada de decisão agêntica — uma pontuação de 95,6 no τ²-Bench é respeitável, mas seu recorte τ-banking, aquele que mede o uso de ferramentas em várias etapas contra os sistemas de um banco, fica em 21,4. Todas essas são medições de terceiros listadas com sua fonte em nosso catálogo, não números do fornecedor, e é por isso que valem mais do que um deck de lançamento.
A outra metade dessa história por requisição é que o modelo não é gratuito. Ele entrou em prévia em fevereiro, meses antes de o atual modelo de fronteira ser lançado, e seu preço está acima da camada barata: US$ 2,00 e US$ 12,00 por milhão de tokens equivalem a cerca de US$ 0,0006 de entrada por página de texto denso, o que não é nada até você rodar uma ingestão de vídeo sobre uma biblioteca — e aí vira um item de custo. Ler um quadro de vídeo custa o mesmo que ler um parágrafo, e o modelo vai cobrar você pelos dois sem pestanejar.

Dois modelos de custo que se recusam a converter
O custo de um dot é uma assinatura com uma franquia não publicada: o primeiro está incluído no Pro ou Business Premium, limites estendidos se aplicam no primeiro mês, conversas com seu dot não consomem os limites de uso do ChatGPT, e não há preço publicado para um segundo dot, para velocidade ou capacidade extra, ou para uma tarefa concluída. O relato da CNBC sobre o keynote traz Sarah Friar precificando o novo nível Pro 500 de $500 como uma franquia de uso mais o modo Ultrafast, e não como uma tarifa por dot, de modo que o plano mais caro na tabela da OpenAI também não gera um custo por unidade de trabalho de agente.
O Gemini 3.1 Pro converte tudo em tokens, incluindo as partes que não são texto. Áudio, vídeo e imagens são faturados como entrada, pelo que o custo de uma tarefa depende de quanto do mundo fez o modelo observar — uma propriedade útil, porque é possível medi-la, e uma perigosa, porque o número mais elevado na fatura é muitas vezes aquele com que ninguém contava. O encaminhamento de modelos ajuda aqui de uma forma específica, e não genérica: com mais de 200 modelos por trás de uma única chave ao preço de tabela do fornecedor, sem qualquer margem, a leitura multimodal dispendiosa e o trabalho de seguimento mais barato podem residir em modelos diferentes no mesmo pipeline, e uma alteração de preços da Google chega à sua conta no próprio dia, em vez de na renovação.

Onde os dois trabalham juntos
O par natural é um dot que coordena e um modelo multimodal que percebe. O trabalho chega, um dot o encaminha: qualquer coisa que precise ser vista ou ouvida vai para o Gemini 3.1 Pro para uma descrição estruturada, e a descrição volta para o fluxo de trabalho, onde um agendamento ou uma regra pode agir sobre ela. O dot trata do acompanhamento; o modelo trata da leitura. Dividir dessa forma também mantém as chamadas de modalidade caras auditáveis, o que importa porque são elas que surpreendem as pessoas.
O modelo é roteado como google/gemini-3.1-pro-previewao preço de tabela do provedor, repassado com 0% de margem, o resto do catálogo, com failover automático entre provedores upstream quando um degrada e uma DSL de roteamento para compor vários modelos em uma única chamada. It is worth being precise about what that does not include: dots are not on our catalogue, there is no endpoint for one, and no model identifier exists to point a request at. If you want the perception layer under your own control — and a preview model from February is exactly the kind of dependency worth containing — the model belongs behind your endpoint and the agent stays wherever you rented it.
De qual verbo o seu problema precisa?
Se o trabalho envolve olhar ou ouvir algo e produzir uma resposta, o Gemini 3.1 Pro é a ferramenta, e o dot é a compra errada. Se o trabalho envolve concluir algo em vários aplicativos sem você dirigir, o dot é a ferramenta, e nenhuma quantidade de entrada multimodal o substitui. As equipes que fazem isso direito rodam os dois e mantêm a fronteira explícita: percepção em um modelo tarifado por uso que você pode medir, ação por trás de um produto que você pode cancelar.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
