
Kandinsky 6.0 Video vs Grok Imagine Video: la classifica si è ribaltata
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 150 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Nel gennaio 2026, quando Grok Imagine Video è stato lanciato, ha dominato l'arena video di Artificial Analysis in entrambe le modalità. Oggi la stessa classifica colloca la sua build attuale all'undicesimo o dodicesimo posto nel text-to-video. Non è uno scandalo e non è un fallimento — è ciò che accade a una categoria in rapida evoluzione in nove mesi, ed è la ragione onesta per confrontare il modello generativo di xAI con Kandinsky 6.0 Video proprio ora. Uno dei due è un servizio ottimizzato per la rapidità con cui puoi produrre un altro clip; l'altro è un checkpoint con licenza MIT, 29 miliardi di parametri nella versione Pro e 3 miliardi nella Lite, rilasciato dal Kandinsky Lab di Sber nella prima settimana di ottobre 2026, che genera cinque secondi di video con audio sincronizzato a 44 kHz e lip-sync. La domanda interessante non è quale dei due sia in vantaggio in una classifica — è cosa ciascuno è strutturalmente in grado di fare dopo.
La tavola che si è mossa sotto di esso
Grok Imagine Video è il modello generativo di xAI, pubblicato per la prima volta il 29 gennaio 2026 e stabile alla versione 1.5 dal 16 giugno. Nella classifica text-to-video di Artificial Analysis, la sua build 1.5 si colloca all'11º–12º posto con Elo 1.045 (±9) su 4.056 voti, indicata a 15,00 $ al minuto. La build originale non è presente in quella classifica.
L'image-to-video è il punto in cui la famiglia è più forte, e in cui le due build si differenziano in un modo che vale la pena leggere con attenzione:
• grok-imagine-video-1.5 — 7°–9°, Elo 1.098 (±8), 5.267 voti, $8,40/min.
• grok-imagine-video (la build di gennaio) — 12°–17°, Elo 1.072 (±7), 14.371 voti, $4,20/min.
• Per dare un'idea, il vertice di quella classifica I2V — MiniMax H3 Max — si attesta a un Elo di 1.195 (±9) su 5.894 voti, e Wan 3.0 è sesto a 1.164.
Seguono due letture, ed entrambe sono vere. La build più recente di xAI è davvero più avanti del suo stesso predecessore nella conversione da immagine a video, di 26 Elo, e costa il doppio al minuto per esserlo. E la storia della settimana di lancio — un modello che è arrivato in cima — non ha retto: il campo si è mosso, l'arena ha accumulato decine di migliaia di voti su una dozzina di sistemi più recenti, e una posizione di metà classifica è dove nove mesi di concorrenza collocano un generatore veloce e generalista.
Kandinsky 6.0 Video non ha alcun Elo su nessuna classifica. Le sue prove sono un'esecuzione VABench e una valutazione umana condotta in laboratorio, entrambe pubblicate da Sber, nessuna delle due riprodotta al di fuori di essa. Collocare un modello aperto non verificato accanto a uno commerciale con punteggio è esattamente il confronto da trattare con cautela: la posizione del modello con punteggio è reale e poco lusinghiera, e la posizione del modello senza punteggio è sconosciuta. "Sconosciuto" non è "meglio".
Due modi di essere veloci, e solo uno di essi si misura in secondi
L'obiettivo di progettazione di Grok Imagine Video è la produttività per singolo creator. È integrato in X, restituisce una clip finita con l'audio, e il suo set di funzionalità si legge come un elenco di cose che le persone fanno davvero in un feed: molteplici rapporti d'aspetto, movimento della camera, aggiunta, rimozione e sostituzione di oggetti, trasferimento di stile, generazione condizionata da riferimenti a partire da più immagini per la coerenza dei personaggi, audio nativo con dialoghi, effetti e musica. La durata delle clip arriva fino a quindici secondi, la risoluzione arriva al massimo a 1080p. L'intero prodotto è costruito in modo che un secondo tentativo ti costi un paio di minuti e qualche centesimo.
Kandinsky 6.0 Video è veloce in un senso diverso — non per tentativo, ma per unità posseduta. Nulla in esso è istantaneo. I tempi di esecuzione riportati dal repository stesso per il modello non distillato, dopo il warmup ed escludendo il caricamento dei pesi e la codifica MP4, collocano una clip Pro Full HD da cinque secondi a circa 402 secondi su una H100, 854 su una RTX 5090, 1.247 su una RTX 4090 e 3.530 su una RTX 5060 Ti. Lite Full HD è di 284 secondi su una H100. Lo strumento che rende tutto questo sopportabile è il checkpoint distillato, che l'articolo ha misurato alla pari con il modello completo — preferito o alla pari sulla maggioranza dei criteri, preferenza media del 51% contro il 49%, nessuna differenza individuale raggiunge la significatività statistica. Quello che ottieni in cambio del rendering lento è un modello sul tuo disco, senza alcun contatore per clip in funzione.
Questa è la vera forma di questo confronto. Grok Imagine Video ottimizza il costo del decimo tentativo. Kandinsky 6.0 Video ottimizza il costo del decimillesimo, e per il primo ti fa pagare in hardware e pazienza.
Entrambi generano audio — e non sono la stessa affermazione
Questo è l'asse su cui un confronto pigro direbbe "pareggio" e sbaglierebbe.
Grok Imagine Video produce audio nativo con dialoghi, effetti e musica come una funzionalità tra tante. È un generatore di uso generale che include anche il suono.
Kandinsky 6.0 Video è costruito attorno al suono. L'architettura è un CrossDiT a doppio flusso che abbina un flusso video inizializzato da Kandinsky 5.0 Video a un flusso audio addestrato da zero su grandi corpora audio, uniti da cross-attention bidirezionale e addestrati congiuntamente. L'output è a 44 kHz con lip-sync esplicito, e si riporta che la fase di reinforcement learning dell'articolo riduca del 47% il word error rate del parlato generato — misurato con Whisper-large-v3, che è uno dei modelli di ricompensa del RL, un dettaglio che conta perché l'articolo riporta un secondo WER non comparabile accanto a VABench usando Qwen3-ASR-1.7B. Il parlato è ciò su cui il modello è stato post-addestrato.
Di contro, lo studio di Sber stesso è schietto su dove perde. Nella valutazione comparativa del laboratorio, MiniMax H3 e Dreamina Seedance 2.0 sono preferiti sui criteri visivi con margini significativi, e il modello è descritto come competitivo anziché superiore. L'affermazione da prendere sul serio è più circoscritta e più utile: rispetto a Kling 2.6 e Veo 3.1 Fast, i risultati si bilanciano criterio per criterio, e Kandinsky 6.0 Video resta competitivo su qualità del parlato e sincronizzazione audio-video, dove una larga parte dei confronti è in parità.
Quindici secondi contro cinque, e quanto costa raggiungere ciascuno
• Durata massima clip — Grok Imagine Video: fino a 15 s. Kandinsky 6.0 Video: 5 s fissi, 121 frame a 24 fps, nessuna modalità di estensione nella release.
• Risoluzione — Grok Imagine Video: fino a 1080p. Kandinsky 6.0 Video: SD, HD e Full HD tramite un modello dedicato di super-risoluzione, upscale x2, x4 o x2,25 di clip di cinque secondi.
• Input di riferimento — Grok Imagine Video: generazione condizionata da riferimenti a partire da più immagini per la coerenza dei personaggi, oltre ad aggiunta/rimozione/sostituzione di oggetti. Kandinsky 6.0 Video: una sola immagine, applicata come fotogramma di coda mascherato.
• Prezzi — Grok Imagine Video: per secondo di output, dall'estremità inferiore dell'intervallo fino a $0,30/s a 1080p, con un costo aggiuntivo per immagine di input; l'accesso gratuito è vincolato ai livelli di abbonamento di X. Kandinsky 6.0 Video: nessuno — nessun servizio, nessuna tariffa, solo il tempo GPU che fornisci.
• Pesi — Grok Imagine Video: no. Kandinsky 6.0 Video: MIT, Pro e Lite, con integrazione diffusers.
Il sovrapprezzo per la nuova build di Grok è il numero da cerchiare. Passare dalla build di gennaio alla 1.5 costa il doppio al minuto nella classifica image-to-video e vale 26 Elo. È un miglioramento reale a un prezzo reale, ed è lo stesso scambio che ogni fornitore di video sta chiedendo agli acquirenti di fare in questo momento.
Dove un router è adatto, e dove no
OrcaRouter non fornisce Grok Imagine Video o Kandinsky 6.0 Video, e nulla qui afferma il contrario: Kandinsky è tuo, puoi scaricarlo ed eseguirlo, mentre a Grok Imagine Video si accede tramite le superfici di xAI stesse. Ciò di cui una pipeline costruita su uno dei due modelli ha bisogno da un router è il testo che circonda il render — la lista delle inquadrature, l'espansione del prompt che trasforma un'idea nella didascalia lunga o breve su cui questi modelli sono stati addestrati, il lavoro di didascalia e trascrizione, e i riepiloghi di revisione che decidono quale generazione viene mantenuta. Questi girano su un unico endpoint compatibile con OpenAI su oltre 200 modelli di testo al prezzo di listino del provider con 0% di ricarico, così un ribasso del fornitore è attivo sulla stessa chiave il giorno in cui arriva, con failover automatico, così una chiamata fallita nel mezzo di una coda di rendering viene reindirizzata invece di bloccare il batch. L'orchestrazione attorno a un modello video è un problema di routing anche quando il modello video stesso non è instradabile, come accade oggi per entrambi.
Quale, e per cosa?
Affidati a Grok Imagine Video quando il lavoro è fatto di volume: clip social, iterazioni rapide, un'inquadratura che rigenererai sei volte prima che sia giusta e una scadenza che non si allunga. Il suo prezzo per tentativo è il prodotto, e il fatto che ora si trovi a metà classifica anziché in vetta è il costo normale di una categoria che si muove così velocemente.
Affidati a Kandinsky 6.0 Video quando il lavoro è una pipeline: un’unità fissa di cinque secondi che puoi elaborare in batch, un passaggio da immagine a video in cui conta la fedeltà a uno still fornito, un parlato che vuoi risulti intelligibile e un deliverable che preferiresti non noleggiare. Metti in conto il rendering, aspettati che sia lento su qualsiasi soluzione di fascia consumer, e considera ogni dato di qualità in questo articolo come di Sber stessa finché qualcuno al di fuori del laboratorio non lo valuta.


Ciò che rende l'accoppiata degna di essere seguita è quale delle due può assorbire un trimestre negativo. Se Grok Imagine Video scivola ancora più in basso nell'arena, la risposta è un modello migliore e un nuovo prezzo — è così che funziona la categoria, e xAI ha già dimostrato che ne rilascerà uno. Se Kandinsky 6.0 Video si rivela da metà classifica una volta valutato, il checkpoint esiste ancora, continua a funzionare e si può ancora fare fine-tuning; nulla della licenza cambia con il numero. Sono tipi diversi di durabilità, e solo uno di essi è misurato da Elo.

