
Dots vs MiniMax M3: Alugar o Trabalhador ou Baixar o Leitor
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 349 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 210 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
O modelo mais barato deste lote é também aquele que você tem permissão para manter, e essa combinação é toda a comparação. O MiniMax M3, publicado em 31 de maio de 2026, é descrito como o modelo de fundação de pesos abertos carro-chefe da MiniMax: texto, imagem e vídeo na entrada com texto na saída, uma janela de contexto de 1.048.576 tokens, até 512.000 tokens de saída em uma única resposta, e um preço de tabela de US$ 0,30 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída, com leituras em cache a US$ 0,06 — cerca de um treze avos do que a fronteira cobra pelos mesmos tokens. Dots é o agente sempre ativo da empresa, anunciado no DevDay em 29 de setembro de 2026: ele ganha seu próprio computador na nuvem e navegador, funciona em mais de 4.000 aplicativos conectados, roda no GPT-6 Astra e vem incluído nos planos Pro e Business Premium, sem nenhum número de cota publicado em lugar algum. Um é um componente que você pode segurar. O outro é um serviço que você só pode assinar.
O preço não é o número interessante.
Trinta centavos por milhão de tokens de entrada é a manchete, mas os números interessantes são os dois que moldam o que você pode pedir. O primeiro é 512.000 tokens de saída máxima — seis vezes o que o GPT-5.6 Sol emitirá em uma resposta, e o maior teto de saída de qualquer modelo neste conjunto de comparação. O segundo é 83 em recall de contexto longo, o que é alto o suficiente para que a janela de contexto seja uma superfície de trabalho utilizável, e não um número em uma ficha técnica.
Junte tudo isso e uma classe específica de tarefa se torna barata: gerar o conteúdo longo a partir da fonte longa. Um manual técnico de 400 páginas reescrito para um público diferente. Um guia de migração produzido a partir de um repositório inteiro. Um resumo de pesquisa que, por si só, tem a extensão de um relatório. A US$ 0,30 e US$ 1,20 por milhão, um trabalho que seria um item de quatro dígitos em um modelo de fronteira é um erro de arredondamento aqui — e o fato de o teto de saída ser medido em centenas de milhares de tokens, e não em dezenas de milhares, é o que faz ser uma única requisição em vez de vinte.
Há uma ressalva que vale a pena mencionar sobre a medição. O painel de latência do nosso catálogo reporta um tempo mediano de 10,00 segundos até o primeiro token para o M3, na mesma janela de sete dias que mostra 18,35 milhões de tokens de tráfego, e esse número fica exatamente no topo da faixa exibida pelo painel. Interprete isso como um artefato da janela, e não como uma caracterização do modelo. O número de tráfego é o que indica que as pessoas realmente o estão usando.

O vídeo é a entrada com a qual ninguém conta.
A visão agora é requisito básico, então a modalidade que ainda diferencia é o vídeo. O M3 aceita vídeo nativamente, ao lado de texto e imagens, e isso muda o formato de um pipeline, em vez de apenas adicionar uma capacidade a uma lista. Um arquivo de suporte de gravações de tela, um conjunto de clipes de dashcam, um semestre de capturas de aula — antes, isso era um problema de pré-processamento, em que você amostrava quadros com uma ferramenta e os descrevia com outra. Um modelo que lê vídeo diretamente colapsa dois estágios em uma única chamada.
Isso também torna a aritmética de custos menos previsível, porque vídeo é caro de examinar de uma forma que texto não é, e o maior número em uma fatura costuma ser a entrada que ninguém previu no orçamento. Uma tarifa barata por token é o que torna seguro experimentar com isso: a US$ 0,30 por milhão de tokens de entrada, uma ingestão ocasional de cinco horas é acessível o suficiente para ser prototipada em vez de discutida em uma reunião de planejamento.
O que os pesos abertos realmente mudam
A MiniMax descreve o M3 como um modelo de pesos abertos, o que significa que os pesos são publicados, e não apenas servidos, e isso é um tipo de garantia diferente de uma subscrição. Se a MiniMax deixasse de o servir amanhã, ou alterasse o preço, ou descontinuasse o identificador, o modelo não desapareceria — continuaria a funcionar no hardware que já tinha comprado, com a quantização que fosse possível. Isso não torna o auto-alojamento mais barato no caso geral; servir você mesmo uma grande mistura de especialistas esparsa é um verdadeiro projeto de engenharia. Torna a dependência sobrevivível, o que é uma afirmação diferente e a que importa quando está a decidir sobre o que construir.
Um ponto oferece a garantia oposta. A OpenAI detém o computador, o navegador, os conectores e a cota, e seu recurso, se algo disso mudar, é parar de usá-lo. Esse é um acordo justo — alugar é como a maioria das equipes deve começar —, mas não é o mesmo acordo, e a diferença só se torna visível no dia em que importa.

Seis diferenças que mudam uma decisão
• Garantia — um serviço que pode alterar os termos, contra pesos que você pode manter (o MiniMax M3 é descrito como de pesos abertos; um ponto não é baixável em sentido algum)
• Custo por unidade de trabalho — não publicado para um ponto, em comparação com $0,30 e $1,20 por milhão de tokens, com leituras em cache a $0,06, a taxa mais baixa neste conjunto de comparação
• Teto de solicitação única — não documentado nem um ponto, contra 1.048.576 tokens de entrada e 512.000 tokens de saída
• Modalidades de entrada — mensagens e dados de aplicativos conectados para um dot, em comparação com texto, imagem e vídeo para o modelo
• Modalidades fora — mudanças dentro de outro software, em oposição a texto e apenas texto
• Classificação independente — não existe benchmark para um ponto; o M3 carrega um Artificial Analysis Intelligence Index de 29,2, o que o coloca na sexagésima posição entre 145 modelos medidos, o que é meio da tabela e vale a pena saber antes de você presumir que a tarifa barata compra raciocínio de ponta. Não compra.
Onde cada um merece sua linha na fatura
A leitura honesta do perfil publicado do M3 é que ele é um modelo de volume, não de fronteira: 92,9 no GPQA Diamond é competitivo, 59 no SWE Bench Pro é respeitável, e o Intelligence Index de meio de tabela é o sinal revelador. Aquilo em que ele ganha é no custo por unidade de trabalho, no teto de saída, em vídeo e na capacidade de implantação, nessa ordem. É um bom modelo para colocar por baixo da camada cara de um pipeline — as etapas de resumir, extrair, transcrever, gerar texto longo e fazer fan-out de muitas tentativas — e um mau modelo para colocar no topo dele.
O OrcaRouter o disponibiliza como minimax/minimax-m3 pelo preço de tabela do provedor MiniMax com 0% de markup, no mesmo catálogo de mais de 200 modelos atrás de uma única chave, com failover automático entre provedores upstream e uma DSL de roteamento para enviar uma solicitação individual ao modelo que deve tratá-la. Esse arranjo é o que torna a divisão em duas camadas prática em vez de teórica: a mesma chave que alcança um modelo barato para volume alcança um modelo de fronteira para as chamadas que precisam estar certas, e nada chega dentro de um ponto porque pontos não estão no catálogo de forma alguma — nenhum endpoint, nenhum identificador, nenhuma inteligência substituta.
O que fazer na segunda-feira
Se você tem um corpus de áudio ou vídeo e nenhuma forma barata de examiná-lo, comece por aí: o M3 é o único modelo deste conjunto que lê vídeo nativamente a esse preço, e o experimento custa quase nada. Se você tem um tipo de trabalho que vive sendo deixado de lado porque ninguém está correndo atrás dele, o dot é o produto moldado para isso, e o modelo com medição não vai fingir ser ele.
Os dois só entram em conflito se você presumir que um precisa vencer. A assinatura persegue; o leitor baixado lê. Seja dono do segundo, alugue o primeiro e mantenha a fronteira entre eles explícita o bastante para que você possa substituir qualquer um dos dois sem reescrever o outro.

