Um cartão de título gerado com o texto 'Kandinsky 6.0 Video vs Grok Imagine Video' e o subtítulo 'O ranking virou', acima de uma fileira de ícones rotulada 'Geração de Vídeo', 'Áudio Sincronizado' e 'Implantação com Pesos Abertos'. O logotipo do OrcaRouter fica no canto inferior direito.
Guides & Insights

Kandinsky 6.0 Video vs Grok Imagine Video: O Ranking Virou

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em janeiro de 2026, quando Grok Imagine Video foi lançado, ele liderou a arena de vídeo do Artificial Analysis nos dois modos. Hoje, o mesmo ranking coloca seu build atual em décimo primeiro ou décimo segundo lugar em texto para vídeo. Isso não é um escândalo e não é um fracasso — é o que acontece com uma categoria que se move rapidamente em nove meses, e é o motivo honesto para comparar o modelo de geração da xAI com o Kandinsky 6.0 Video agora. Um deles é um serviço otimizado para a rapidez com que você consegue produzir outro clipe; o outro é um checkpoint com licença MIT, com 29 bilhões de parâmetros no tamanho Pro e 3 bilhões no Lite, lançado pelo Kandinsky Lab da Sber na primeira semana de outubro de 2026, gerando cinco segundos de vídeo com áudio sincronizado de 44 kHz e sincronia labial. A pergunta interessante não é qual deles está à frente em um ranking — é o que cada um é estruturalmente capaz de fazer a seguir.

A tábua que se moveu sob ele

Grok Imagine Video é o modelo de geração da xAI, lançado inicialmente em 29 de janeiro de 2026 e estável na versão 1.5 desde 16 de junho. No ranking de texto para vídeo da Artificial Analysis, sua build 1.5 ocupa a 11ª–12ª posição, com Elo 1.045 (±9) em 4.056 votos, listada a US$ 15,00 por minuto. A build original não está nesse ranking.

Image-to-video é onde a família é mais forte e onde as duas versões se separam de um modo que vale a pena ler com atenção:

• grok-imagine-video-1.5 — 7.º–9.º, Elo 1 098 (±8), 5 267 votos, $8,40/min.

• grok-imagine-video (a versão de janeiro) — 12º–17º, Elo 1.072 (±7), 14.371 votos, $4,20/min.

• Para se ter uma ideia da escala, o topo daquele ranking I2V — MiniMax H3 Max — está em Elo 1.195 (±9), com 5.894 votos, e o Wan 3.0 é o sexto, com 1.164.

Seguem-se duas leituras, e ambas são verdadeiras. A versão mais recente da xAI está genuinamente à frente de sua própria predecessora em imagem para vídeo, por 26 Elo, e custa o dobro por minuto para estar nessa posição. E a história da semana de lançamento — um modelo que chegou ao topo — não se sustentou: o campo se moveu, a arena acumulou dezenas de milhares de votos em uma dúzia de sistemas mais novos, e uma posição de meio de tabela é onde nove meses de competição colocam um gerador rápido e de propósito geral.

Kandinsky 6.0 Video não tem Elo em nenhum ranking. Suas evidências são uma execução do VABench e uma avaliação humana feita em laboratório, ambas publicadas pela Sber, nenhuma delas reproduzida fora dela. Colocar um modelo aberto não auditado ao lado de um modelo comercial pontuado é exatamente o tipo de comparação que exige cuidado: a posição do modelo pontuado é real e nada lisonjeira, e a posição do modelo não pontuado é desconhecida. "Desconhecido" não é "melhor".

Dois tipos de rápido, e apenas um deles é medido em segundos

O objetivo de design do Grok Imagine Video é a produtividade por criador. Ele está integrado ao X, entrega um clipe finalizado com som, e seu conjunto de recursos lê como uma lista de coisas que as pessoas realmente fazem em um feed: várias proporções de tela, movimento de câmera, adicionar, remover e substituir objetos, transferência de estilo, geração condicionada por referência a partir de várias imagens para consistência de personagem, áudio nativo com diálogo, efeitos e música. A duração dos clipes chega a até quinze segundos, e a resolução vai no máximo até 1080p. O produto inteiro foi construído para que uma segunda tentativa custe alguns minutos e alguns centavos.

O Kandinsky 6.0 Video é rápido num sentido diferente — não por tentativa, mas por unidade de propriedade. Nada nele é instantâneo. Os próprios tempos de execução do repositório para o modelo não destilado, após o aquecimento e excluindo o carregamento de pesos e a codificação MP4, colocam um clipe Pro Full HD de cinco segundos em cerca de 402 segundos numa H100, 854 numa RTX 5090, 1.247 numa RTX 4090 e 3.530 numa RTX 5060 Ti. O Lite Full HD é de 284 segundos numa H100. A ferramenta que torna isso suportável é o checkpoint destilado, que o artigo mediu em paridade com o modelo completo — preferido ou empatado na maioria dos critérios, preferência média de 51% a 49%, sem nenhuma diferença individual a atingir significância. O que você obtém em troca da renderização lenta é um modelo no seu próprio disco, sem nenhum medidor por clipe a funcionar.

Essa é a verdadeira forma deste confronto. O Grok Imagine Video otimiza o custo da décima tentativa. O Kandinsky 6.0 Video otimiza o custo da décima milésima, e cobra de você em hardware e paciência pela primeira.

Ambos geram áudio — e não são a mesma afirmação

Este é o eixo em que uma comparação preguiçosa diria "empate" e estaria errada.

O Grok Imagine Video produz áudio nativo com diálogos, efeitos e música como um recurso entre muitos. É um gerador de propósito geral que, por acaso, inclui som.

Kandinsky 6.0 Video é construído em torno do som. A arquitetura é um CrossDiT de duplo fluxo que emparelha um fluxo de vídeo inicializado a partir do Kandinsky 5.0 Video com um fluxo de áudio treinado de raiz em grandes corpora de áudio, unidos por atenção cruzada bidirecional e treinados em conjunto. A saída é de 44 kHz com sincronização labial explícita, e a fase de aprendizagem por reforço do artigo é reportada como reduzindo a taxa de erro de palavras da fala gerada em 47% — medida com o Whisper-large-v3, que é um dos modelos de recompensa de RL, um detalhe que importa porque o artigo reporta uma segunda WER não comparável, juntamente com o VABench, usando o Qwen3-ASR-1.7B. A fala é aquilo em que o modelo foi pós-treinado.

Em contrapartida, o próprio estudo da Sber é franco sobre onde perde. Na avaliação comparativa do laboratório, MiniMax H3 e Dreamina Seedance 2.0 são preferidos em critérios visuais por margens significativas, e o modelo é descrito como competitivo, e não à frente. A afirmação que vale levar a sério é mais restrita e mais útil: contra Kling 2.6 e Veo 3.1 Fast, os resultados alternam-se critério a critério, e Kandinsky 6.0 Video permanece competitivo em qualidade de fala e sincronização de áudio e vídeo, onde uma grande fração das comparações são empates.

Quinze segundos contra cinco, e quanto custa alcançar cada um.

• Clipe máximo — Grok Imagine Video: até 15s. Kandinsky 6.0 Video: 5s fixos, 121 quadros a 24 fps, sem modo de extensão no lançamento.

• Resolução — Grok Imagine Video: até 1080p. Kandinsky 6.0 Video: SD, HD e Full HD por meio de um modelo dedicado de super-resolução, com ampliações x2, x4 ou x2,25 de clipes de cinco segundos.

• Entrada de referência — Grok Imagine Video: geração condicionada por referência a partir de várias imagens para consistência de personagens, além de adicionar/remover/substituir objetos. Kandinsky 6.0 Video: uma imagem, aplicada como quadro final mascarado.

• Preços — Grok Imagine Video: por segundo de saída, desde o limite inferior da faixa até US$ 0,30/s em 1080p, com uma cobrança adicional por imagem de entrada; o acesso gratuito fica atrás dos níveis de assinatura do X. Kandinsky 6.0 Video: nenhum — nenhum serviço, nenhuma tarifa, apenas o tempo de GPU que você fornece.

• Pesos — Grok Imagine Video: não. Kandinsky 6.0 Video: MIT, Pro e Lite, com integração com diffusers.

O prêmio pela versão mais recente do Grok é o número a destacar. Passar da versão de janeiro para a 1.5 custa o dobro por minuto no ranking de imagem para vídeo e rende 26 Elo. É uma melhoria real por um preço real, e é a mesma troca que todo fornecedor de vídeo está pedindo que os compradores façam agora mesmo.

Onde um router se encaixa e onde não

O OrcaRouter não oferece o Grok Imagine Video nem o Kandinsky 6.0 Video, e nada aqui afirma o contrário: o Kandinsky está disponível para você baixar e executar, e o Grok Imagine Video é acessado pelas próprias interfaces da xAI. O que um pipeline construído sobre qualquer um dos modelos precisa que um roteador forneça é o texto que cerca a renderização — a lista de planos, a expansão de prompt que transforma uma ideia na legenda longa ou curta com a qual esses modelos foram treinados, o trabalho de legendagem e transcrição, e os resumos de revisão que decidem qual geração é mantida. Esses processos rodam em um único endpoint compatível com OpenAI, em mais de 200 modelos de texto ao preço de tabela do provedor, com 0% de markup, então um lançamento de fornecedor fica ativo na mesma chave no dia em que chega, com failover automático para que uma chamada com falha no meio de uma fila de renderização seja redirecionada em vez de travar o lote. A orquestração em torno de um modelo de vídeo é um problema de roteamento mesmo quando o próprio modelo de vídeo não é roteável, que é o caso de ambos hoje.

Qual deles, e para quê?

Recorra ao Grok Imagine Video quando o trabalho é volume: clipes para redes sociais, iterações rápidas, uma tomada que você vai regenerar seis vezes antes de acertar e um prazo que não se estende. O seu preço por tentativa é o produto, e estar agora no meio da tabela, em vez de no topo, é o custo normal de uma categoria que se move tão rápido.

Recorra ao Kandinsky 6.0 Video quando o trabalho for um pipeline: uma unidade fixa de cinco segundos que você pode processar em lote, um passo de imagem para vídeo em que a fidelidade a uma imagem estática fornecida é o que importa, uma fala que você pretende que seja inteligível, e um entregável que você preferiria não alugar. Reserve orçamento para a renderização, espere uma lenta em qualquer coisa de nível consumidor, e trate cada número de qualidade neste texto como sendo da própria Sber até que alguém de fora do laboratório o avalie.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

O que torna este confronto digno de acompanhar é saber qual dos dois consegue absorver um trimestre ruim. Se o Grok Imagine Video cair ainda mais na arena, a resposta é um modelo melhor e um novo preço — é assim que a categoria funciona, e a xAI já mostrou que vai lançar um. Se o Kandinsky 6.0 Video se revelar a meio da tabela depois de ser avaliado, o checkpoint continua a existir, continua a ser executado e continua a permitir ajuste fino; nada na licença muda com o número. São tipos diferentes de durabilidade, e apenas um deles é medido pelo Elo.

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.