
Agora-2 vs MiniMax M3: Uma GPU por participante, ou treze centavos por milhão de tokens
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Duas maneiras de executar uma multidão de agentes, com preços em duas moedas diferentes. MiniMax M3 custa US$ 0,30 por milhão de tokens de entrada e US$ 1,20 por milhão de saída — uma tarifa que transforma um experimento com mil agentes em uma linha de orçamento, e não em uma rodada de financiamento. Agora-2, o modelo de mundo multiagente que a Odyssey apresentou em prévia em 21 de setembro de 2026, custa uma NVIDIA RTX PRO 4500 por visão de participante: uma sessão de quatro jogadores roda em quatro GPUs, com um modelo de renderização por placa gerando a perspectiva 640×480 daquele jogador, e uma dessas quatro placas também carrega a simulação compartilhada e as dezesseis políticas de agentes autônomos. O número do MiniMax M3 é por token e escala com o quanto seus agentes pensam. O número do Agora-2 é por olho e escala com quantos participantes simultâneos você coloca no mundo. Compará-los é comparar um orçamento de raciocínio com um orçamento de renderização e, para quem planeja um estudo multiagente em 2026, isso acaba sendo a coisa útil a fazer.
O lado do token do livro razão
MiniMax M3 é o carro-chefe de pesos abertos da MiniMax, lançado em 31 de maio de 2026: uma mistura esparsa de especialistas com 428 bilhões de parâmetros, com cerca de 23 bilhões de parâmetros ativos por token, uma janela de contexto de 1.048.576 tokens da qual a MiniMax garante 512K utilizáveis, entrada de texto, imagem e vídeo, e uma pontuação de 29 no Artificial Analysis Intelligence Index v4.3.2. Ele reporta 83,5 no BrowseComp e 76,1 no BankerToolBench em números do fornecedor — números da própria MiniMax, não reproduzidos aqui — e a Artificial Analysis o mede em 145 tokens de saída por segundo, o décimo modelo mais rápido nesse ranking.
O número relevante para frotas de agentes, porém, é a taxa de leitura de cache: US$ 0,06 por milhão de tokens em cache, um quinto do preço de entrada. Os loops de agentes são dominados por prefixos — o mesmo prompt de sistema, os mesmos esquemas de ferramentas, o mesmo histórico acumulado, reenviados a cada turno —, então o custo efetivo de um loop fica muito mais próximo de US$ 0,06 do que de US$ 0,30 para a maior parte de seus tokens. É essa aritmética que faz com que uma execução de 1.200 agentes, do tipo que a METR documentou dentro da avaliação ExploitGym da OpenAI de julho de 2026, seja algo que um grupo de pesquisa pode realmente reproduzir, em vez de apenas ler a respeito.
O lado da GPU do livro-razão
A estrutura de custos da Agora-2 é divulgada em seu próprio apêndice de implementação, e é refrescantemente concreta. Uma RTX PRO 4500 Blackwell Server por visão. Quatro para uma sessão de quatro jogadores. Essas placas geram a visão de cada participante a uma meta de quinze atualizações latentes e trinta quadros exibidos por segundo em 640×480, e a simulação avança em um tick de 30 Hz. O relatório também fornece a escala de treinamento do trabalho associado: um lote global efetivo de 128 em 32 GPUs B200.
Convertido para a mesma unidade do MiniMax M3, isto é, uma GPU de datacenter por participante simultâneo, mais a simulação compartilhada rodando junto em uma delas. É um custo fixo que não se importa com quanto tempo seus agentes deliberam e não cai quando eles ficam em silêncio. Seguem-se duas consequências, e elas apontam em direções opostas. Com poucos participantes e raciocínio pesado por agente, o modelo de tokens é obviamente mais barato — você paga centavos pelo raciocínio e nada pelo segundo agente na sala. Com muitos participantes e interação densa, a aritmética se inverte: vinte participantes simultâneos em um mundo compartilhado são vinte GPUs, um número que não cresce com o número de tokens que cada um gasta.
• Unidade de custo — Agora-2: uma RTX PRO 4500 por visualização de participante vs. MiniMax M3: $0.30/$1.20 por 1 milhão de tokens
• Leituras de cache — Agora-2 não aplicável, sem cobrança de tokens vs MiniMax M3 $0,06 por 1M em cache
• Pontuação independente — Agora-2 nenhuma publicada vs MiniMax M3 AA Intelligence Index 29 (v4.3.2)
Contexto — estado compartilhado do Agora-2 mais histórico limitado por visualização vs. MiniMax M3 1.048.576 tokens, 512K garantidos
• Saída — vídeo Agora-2 640×480 a uma meta de 30 fps vs. texto MiniMax M3
• Acesso — pré-visualização do Agora-2 no navegador, sem API, sem pesos vs pesos abertos do MiniMax M3, licença comunitária, API


Por que os dois custos não são substitutos
É tentador ler isto como uma escolha de um ou outro, e não é. MiniMax M3 é um cérebro de política: ele lê uma situação parcialmente observada, raciocina, chama ferramentas e emite uma ação. Agora-2 é um ambiente no qual as ações têm consequências visíveis para os outros participantes — um modelo de simulação que prevê como ações combinadas alteram o estado compartilhado, um servidor de mundo que as aplica e renderizadores por visão, para que cada participante veja o mesmo mundo a partir de sua própria perspectiva. As dezesseis entidades autônomas da Odyssey não são guiadas por nenhum modelo de linguagem; são políticas recorrentes escalares e espaciais treinadas com aprendizado por reforço, consumindo um histórico de dezesseis observações e agindo a cada quatro ticks de simulação. Essa escolha de design é a pista. A trinta ticks por segundo, decidir o que fazer é um problema de controle, e problemas de controle são resolvidos treinando uma política pequena em vez de chamar uma API.
Então, o enquadramento honesto para uma equipe que planeja trabalho multiagente é que estes vivem em camadas diferentes e você precisa de um orçamento para cada uma. A camada de raciocínio é barata e elástica, e você pode escolhê-la no mercado. A camada de ambiente, se você quiser algo que não seja um motor de jogo, atualmente é uma prévia de pesquisa com uma pegada em formato de GPU e sem API publicada. Ambos os fatos são recentes o suficiente — M3 desde maio, Agora-2 desde setembro — para que quase ninguém tenha ainda um modelo de custos para a combinação.
O que é verificado e o que é uma meta
A pontuação independente, a janela de contexto, as modalidades e o preço do MiniMax M3 são fatos publicados, verificáveis hoje. Os números do BrowseComp e do BankerToolBench são relatados pelo fornecedor e devem ser rotulados como tal sempre que você os citar.
Os números do Agora-2 vêm inteiramente do relatório técnico da Team Odyssey e não foram reproduzidos por ninguém fora da empresa. O seu resultado de renderização — 30,11 dB de PSNR para o renderizador de prefixo estruturado, contra 20,67 dB para uma linha de base VAE em trinta clipes de monitoramento — é uma comparação de sistemas completos com orçamentos de treinamento desiguais, como o próprio relatório observa. A sua redução de 45,8% no tempo do denoiser em relação à atenção cruzada vem de denoisers inicializados aleatoriamente em entradas sintéticas e mede o custo de execução, e não a qualidade da imagem. E a sua seção de limitações afirma claramente que as taxas de quinze atualizações por segundo e trinta quadros por segundo são metas; que a taxa de quadros sustentada e a latência de entrada até a exibição durante interação ao vivo com múltiplos agentes "não foram avaliadas quantitativamente"; que a qualidade visual de longo horizonte, a concordância entre visões e a aderência de ações ponta a ponta permanecem não avaliadas; que o ambiente precisa de um motor instrumentado com geometria explícita e um vocabulário de aparência fixo; e que a transferência para além do domínio de treinamento não foi testada. Qualquer pessoa que esteja construindo um modelo de custo com uma GPU por visão deve ler essa seção primeiro, porque a vazão por GPU é exatamente o que não foi medido.
A chamada
Se você está construindo frotas de agentes — muitos modelos, loops longos, chamadas de ferramentas, sem renderização — o MiniMax M3 é a forma mais barata e confiável de fazer isso em escala, e a tarifa de leitura de cache é o número que decide sua fatura. Ele é roteado no OrcaRouter pelo preço de tabela do próprio MiniMax, sem nenhum markup, então a tarifa de US$ 0,06 para tokens em cache é o que você paga, com failover entre provedores caso um endpoint se degrade no meio da execução. Especificamente para frotas, o repasse importa mais do que o habitual: uma margem de revenda sobre tokens em cache é uma margem multiplicada por cada turno de cada agente.

Agora-2 não é algo para o qual você possa rotear — não há API, nem preço, nem pesos, apenas a prévia no navegador da Odyssey — e não o hospedamos. O que ele é, é o primeiro simulador de mundo compartilhado construído especificamente para que muitos participantes, humanos e sintéticos, possam ser observados interagindo sob condições controladas, e o relatório por trás dele é excepcionalmente franco sobre o quão longe ele está atualmente de ser um produto. Se o seu problema é raciocínio em volume, o MiniMax M3 está disponível agora e é barato. Se o seu problema é o que acontece quando mil desses motores de raciocínio compartilham um mundo, a Odyssey construiu a arena e deixou as medições difíceis para outra pessoa executar.
