
MiMo-V2.6-Pro vs GPT-5.6 Sol: Um Ponto de Índice Custa Quinze Vezes Mais por Tarefa
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
No Artificial Analysis Intelligence Index v4.3.2, consultado em 25 de setembro de 2026, o GPT-5.6 Sol com esforço máximo obtém 47, e o MiMo-V2.6-Pro da Xiaomi obtém 46. Um ponto. O número que de fato os separa não é a pontuação e não é a taxa por token — é o custo de uma única tarefa do índice, que a Artificial Analysis divulga como US$ 1,99 para o GPT-5.6 Sol e US$ 0,13 para o MiMo-V2.6-Pro. Quinze vezes o dinheiro por um ponto. E, no momento desta consulta, a própria página do avaliador para esse modelo traz um aviso de descontinuação, porque o GPT-6 Sol o substituiu.
A Xiaomi publicou os pesos e o relatório técnico do MiMo-V2.6-Pro em 21 de setembro de 2026, quatro dias antes desta leitura; a OpenAI lançou o GPT-5.6 Sol em 9 de julho de 2026. Ambos os fatos acima são novos desde a última vez em que este pareamento foi escrito, e eles puxam em direções opostas. O aviso de descontinuação diz que a comparação é com um modelo que a OpenAI já deixou para trás. O número por tarefa diz que aquilo que parecia um erro de arredondamento quando ambos os modelos eram cotados pelo preço de tabela é, em uma carga de trabalho real, a decisão inteira. Qual dos dois importa depende de você estar comprando um modelo ou substituindo um.
O que as duas páginas agora dizem
O GPT-5.6 Sol foi lançado em 9 de julho de 2026 como o carro-chefe da família GPT-5.6. Seu preço de tabela é de US$ 4,00 por milhão de tokens de entrada e US$ 20,00 por milhão de saída na API própria da OpenAI, com 90% de desconto de cache, e a página registra 90 milhões de tokens de saída gerados ao longo da execução do índice, em comparação com uma mediana de 88 milhões. Ele mediu 73 tokens de saída por segundo, o que a mesma página considera mais rápido que a média, em comparação com uma mediana de 72 t/s. Sua entrada no índice está na posição 19 de 210 modelos em sua classe.
O Xiaomi MiMo-V2.6-Pro é um checkpoint de mistura esparsa de especialistas com 1,02 trilhão de parâmetros totais e 42 bilhões ativos, licenciado sob a licença MIT, com uma janela de contexto de 1M tokens e entrada de texto, imagem, fala e vídeo com saída de texto. Tem preço de tabela de US$ 0,43 e US$ 0,87 por milhão de tokens, com 99% de desconto de cache — um décimo da tarifa de entrada do Sol e um vinte e três avos da tarifa de saída dele. Ele gerou 140 milhões de tokens de saída na execução do índice e registrou 43,6 tokens de saída por segundo, o que sua página descreve como notavelmente lento em comparação com uma mediana de 67,1 t/s.
• Custo da tarefa de índice — MiMo-V2.6-Pro $0.13; GPT-5.6 Sol $1.99 — a diferença é de 15× • Preço de tabela — MiMo-V2.6-Pro $0.43 / $0.87 por 1M; GPT-5.6 Sol $4.00 / $20.00 • Desconto de cache — MiMo-V2.6-Pro 99%; GPT-5.6 Sol 90% • Tokens de saída na execução do índice — MiMo-V2.6-Pro 140M; GPT-5.6 Sol 90M • Velocidade de saída — MiMo-V2.6-Pro 43,6 t/s, contra uma mediana de 67,1; GPT-5.6 Sol 73 t/s, contra uma mediana de 72 • Contexto e pesos — MiMo-V2.6-Pro 1M e licenciado sob MIT; GPT-5.6 Sol 1M e proprietário

O aviso de descontinuação é a linha mais relevante.
A Artificial Analysis agora abre a página do GPT-5.6 Sol com um aviso em destaque: “Este modelo está obsoleto. Continuamos apenas o benchmarking de desempenho para a carga de trabalho padrão de 10k tokens de entrada”, seguido pela frase de que a OpenAI lançou um modelo mais novo, o GPT-6 Sol (max), e que ele deve ser considerado em vez deste. O 47 no índice é, portanto, uma leitura de um modelo que já não é o que se deve comprar. Isso não torna a leitura errada — ela foi medida no mesmo índice, no mesmo dia, na mesma configuração de esforço que o 46 —, mas muda para que serve a comparação. Já não é “qual flagship devo usar”. É “quanto custa o topo do ranking de modelos proprietários, no momento em que ele era o topo”.
Esse enquadramento importa mais do que parece, porque avisos de descontinuação em páginas de avaliadores são um dos poucos lugares em que a cadência de produtos de um fornecedor aparece como uma mudança nos dados, e não como um comunicado à imprensa. A pontuação está congelada; o modelo não está disponível. Qualquer coisa que você construa com base no 47 estará construindo com base em um snapshot.

Por que o número por tarefa é aquele com o qual se deve modelar
As taxas por token favorecem modelos baratos e enganam em cargas de trabalho que não são neutras em tokens. O custo da tarefa do índice é uma medição diferente: é o que o avaliador realmente gastou para obter uma resposta de cada modelo, o que incorpora tanto a taxa quanto o número de tokens que o modelo escolheu emitir. O MiMo-V2.6-Pro emite mais tokens do que o Sol na execução do índice — 140 milhões contra 90 milhões, cerca de 1,6 vezes mais — e ainda custa US$ 0,13 por tarefa contra US$ 1,99. A vantagem de taxa é de aproximadamente vinte e três vezes na saída; a penalidade de verbosidade é de 1,6×; o produto é a diferença de quinze vezes por tarefa.
Essa é a aritmética na qual um modelo de custos deveria se basear, e é a aritmética que fica invisível se você comparar US$ 0,87 com US$ 20,00 e parar por aí. Ela também mostra o que quebraria a conclusão. Se sua carga de trabalho for dominada por saídas muito curtas, a contagem de tokens do Sol cai na direção da sua, e a diferença de preço de vinte e três vezes faz a maior parte do trabalho, de modo que o múltiplo real se aproxima da diferença de preço, e não se afasta dela. Se sua carga de trabalho for dominada por longos traços de raciocínio, a verbosidade de 1,6× do MiMo-V2.6-Pro se acumula, e US$ 0,13 passa a ser o teto, não a estimativa. O número publicado é uma medição do formato de um benchmark, não uma cotação que você pode entregar ao financeiro.
A linha de latência é o contrapeso honesto
A 43,6 tokens de saída por segundo, o MiMo-V2.6-Pro é mais lento que o GPT-5.6 Sol, medido no mesmo dia em 73 — e mais lento que os modelos com os quais a própria página dele o compara, cuja mediana é 67,1. A página dele diz isso com todas as letras: “notavelmente lento”. Para um pipeline em lote, este é um custo de throughput que você consegue precificar. Para um agente interativo, é uma decisão de produto, e ser quinze vezes mais barato por tarefa não torna um modelo lento rápido. Se a sua restrição é um orçamento por turno, e não uma conta mensal, a razão que importa é 43,6 contra 73, e o MiMo-V2.6-Pro sai perdendo.
Onde isso chega em um roteador
A forma útil deste emparelhamento não é “escolher um”. É que ambos os modelos respondem ao mesmo índice e o avaliador publica um custo por tarefa para cada um, pelo que a divisão pode ser feita com base no custo medido e não em níveis de fornecedor. No OrcaRouter, o catálogo vai até mais de 200 modelos atrás de uma única chave, ao preço de tabela de cada fornecedor com 0% de margem — um corte de preço do fornecedor chega à sua fatura no mesmo dia, sem um segundo contrato para renegociar — e a DSL de encaminhamento permite que uma carga de trabalho envie as chamadas baratas e de grande volume para um modelo e as difíceis para outro, por tarefa e não por marca. O failover automático cobre o caso em que a rota mais barata está degradada. O Xiaomi MiMo-V2.6-Pro não está nas nossas rotas — não listamos um modelo antes de um fornecedor o ter integrado —, pelo que, para esse lado da comparação, a resposta honesta é a própria API do fornecedor ou a plataforma alojada com que já tenha uma relação.

O que fazer com isso até a próxima semana
Duas coisas mudaram a 25 de setembro de 2026 e apenas uma delas é sobre preço. O GPT-5.6 Sol tem um aviso de descontinuação no índice onde foi medido em 47, o que o retira como decisão de compra e o deixa como referência de benchmark. O MiMo-V2.6-Pro é medido em $0,13 por tarefa de índice, contra os $1,99 do Sol, o que é quinze vezes o dinheiro por um ponto de índice — e é 43,6 tokens por segundo, o que é mais lento do que o modelo com que está a ser comparado e mais lento do que a mediana da sua própria classe. Confronte os dois números com o seu próprio tráfego antes que qualquer deles se torne uma decisão: o custo por tarefa é uma medição, não uma tarifa, e a latência é uma medição, não uma opinião. Se os seus resultados são curtos e não interativos, o argumento a favor do checkpoint aberto é mais forte do que o fosso do índice sugere. Se os seus resultados são longos ou os seus utilizadores estão à espera, a poupança de quinze vezes compra-lhe um produto mais lento, e isso é uma troca que só a sua carga de trabalho pode avaliar.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
