
Dots vs Kimi K3: Um Lê a Biblioteca Inteira, o Outro Vai e Encontra
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 349 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 210 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Há um tipo específico de trabalho que apenas um destes dois consegue fazer, e vale a pena nomeá-lo antes de qualquer outra coisa. Kimi K3, publicado pela Moonshot AI em 15 de julho de 2026, é um modelo de mistura de especialistas com 2,8 trilhões de parâmetros e uma janela de contexto de 1.048.576 tokens que aceita texto e imagens e devolve texto, com preço de US$ 3,00 por milhão de tokens de entrada e US$ 15,00 por milhão de tokens de saída, com leituras em cache a US$ 0,30. Dots é o agente sempre ativo da empresa, anunciado no DevDay em 29 de setembro de 2026, com seu próprio computador na nuvem e navegador, conectores para mais de 4.000 aplicativos e um lugar dentro do ChatGPT, Slack e Teams, rodando no GPT-6 Astra e incluído nos planos Pro e Business Premium. O K3 consegue manter um acervo inteiro em uma única requisição e responder a perguntas sobre ele. Um dot consegue ir buscar o próximo documento em que você ainda não pensou. Ler e recuperar são trabalhos diferentes, e escolher o errado é o erro caro.
O número que o Kimi K3 detém com exclusividade.
O recall de contexto longo é a métrica que separa o marketing da capacidade, porque uma janela de contexto grande é trivial de reivindicar e difícil de usar. O K3 obtém 88,7 nele — o valor mais alto de qualquer modelo que listamos, acima dos 84 do GPT-5.6 Sol, dos 83 do MiniMax M3 e dos 82 do Gemini 3.1 Pro. Também regista 93,5 no GPQA Diamond e 59,5 no SciCode, e tem um Artificial Analysis Coding Index de 76,2, que o coloca em nono lugar entre 138 modelos medidos, e um Intelligence Index de 43,6, em décimo nono lugar entre 145. Todos estes são valores de terceiros, apresentados no nosso catálogo com as respetivas fontes anexadas, em vez de repetidos de uma publicação de lançamento.
O que isso lhe proporciona é uma classe de tarefa que simplesmente não se decompõe: ler uma base de código inteira antes de responder a uma pergunta sobre ela, fazer o diff de um ano de contratos com um novo template, ou manter uma longa sessão agêntica sem que o meio dela saia da memória. O K3 foi construído exatamente para isso — a Moonshot o posiciona para agentes de programação e trabalho intelectual de longo horizonte — e é incomum por recusar totalmente parâmetros de amostragem. Não há temperature, nem top_p, nem seed; a profundidade de raciocínio é um único controle chamado reasoning_effort. Trata-se de uma troca deliberada: menos controles, mais consistência ao longo de uma sessão longa.

Para que serve um ponto, dito sem o marketing
Um ponto é um trabalhador com um calendário. Suas entradas são mundanas — suas mensagens, os dados do seu aplicativo, uma tarefa que você descreveu em uma frase — e sua saída é uma mudança em outro lugar: um arquivo movido, um ticket atualizado, uma mensagem redigida e enviada após sua aprovação, uma página aberta no próprio navegador dele. Os materiais de lançamento da OpenAI descrevem um que leva vários projetos adiante ao mesmo tempo e aprende com o feedback, e a leitura honesta é que você está comprando o tecido conjuntivo, não a inteligência.
O tecido conjuntivo é a parte cara de construir. Um navegador que se comporta como o de uma pessoa, conectores mantidos pelos fornecedores dos aplicativos, uma visão de atividades, portões de aprovação, isolamento da sua própria máquina — nada disso é difícil em princípio, e tudo isso é tedioso na prática. É isso que a assinatura custeia. O que ela não custeia é a mensurabilidade.
• Custo — incluído no Pro ou Business Premium, cota não divulgada (Dots) contra $3,00 por milhão de entrada e $15,00 por milhão de saída, leituras em cache $0,30 (Kimi K3)
• Teto em uma única solicitação — não documentado por um ponto, contra 1.048.576 tokens de contexto e um 88,7 amigável para dispositivos móveis em recall de contexto longo (Kimi K3)
• Entrada e saída — mensagens e dados de aplicativos conectados entram, alterações dentro de outros softwares saem (Dots) versus texto e imagem entram, texto sai (Kimi K3)
• Controle de amostragem — nenhum publicado (Dots) versus ausência de temperature, de top_p e de seed, com a profundidade de raciocínio definida apenas por reasoning_effort (Kimi K3)
• Velocidade que você deve esperar — não documentada para um ponto, contra uma mediana de 8,82 segundos até o primeiro token e cerca de 39 tokens de saída por segundo em nossa própria medição de sete dias (Kimi K3)
• Evidência independente — demonstrações de fornecedores e declarações de capacidades, sem benchmark (Dots) em relação ao AA Coding Index 76,2, em nono lugar entre 138, GPQA Diamond 93,5, recall de contexto longo 88,7 (Kimi K3)
A coisa que ninguém menciona sobre comprar um agente
Uma assinatura com uma franquia não divulgada tem uma propriedade que uma tabela de preços não tem: você não consegue distinguir entre uma tarefa que foi barata e uma tarefa que foi cara. Cada trabalho custa o mesmo — nada marginal — bem até o momento em que deixa de ser assim, e então a resposta chega como um limite, e não como uma fatura. Para uma equipe cujo trabalho é exploratório, isso é uma vantagem. Para uma equipe que precisa atribuir custos a um projeto, é uma lacuna na contabilidade.
Há também um efeito de segunda ordem. Quando o custo marginal de uma chamada é invisível, você para de perguntar se a chamada era necessária, e a otimização mais barata em qualquer pipeline — não fazer a requisição — torna-se indisponível para você. Um modelo medido força essa pergunta toda vez que alguém lê a tabela de preços.

Compondo-os sem fingir que são alternativas
A forma que funciona é um ponto que percebe e um modelo de contexto longo que lê. O trabalho chega — um documento em um drive compartilhado, uma mensagem em uma conversa — e o ponto decide se aquilo importa. Se importar, o documento vai para o Kimi K3 com tudo o mais de que possa precisar anexado, em uma única solicitação, e a resposta volta totalmente fundamentada na fonte, e não em um resumo da fonte. O ponto cuida de correr atrás das coisas e da logística entediante; o modelo cuida da leitura, em um volume que nenhum ciclo de pequenas chamadas teria conseguido montar corretamente.
O Kimi K3 é roteado no OrcaRouter como kimi/kimi-k3 ao preço de tabela da Moonshot, sem acréscimo de margem, ficando em o mesmo catálogo que mais de 200 outros modelos por trás de uma única chave, com failover automático entre provedores upstream quando um deles degrada e uma DSL de roteamento para compor vários modelos em uma única chamada. Essa é a metade medida do pipeline e nada mais: os dots não estão no catálogo, não há endpoint para um deles, e não existe identificador para apontar uma requisição. Se a camada de leitura é a parte que você precisa controlar — e, para qualquer coisa que você pretenda executar por um ano, geralmente é —, essa é a camada que você deve dominar.
Qual compra desperdiça dinheiro?
Comprar um dot para ler um grande corpus é um desperdício, porque o dot vai buscar e resumir em vez de reter o todo, e é na sumarização que os detalhes de que você precisava morrem. Comprar o Kimi K3 para acompanhar um projeto por cinco aplicativos é um desperdício pelo motivo espelhado: um modelo que responde quando chamado não chama você.
Se o trabalho é recuperação e logística, alugue o trabalhador. Se o trabalho é compreensão em escala, compre o medidor e dê tudo a ele de uma vez. Os dois se sobrepõem muito menos do que a palavra "agentic" sugere, e a sobreposição não é onde nenhum dos dois é bom.

Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
