
Odyssey-3 против Kandinsky 6.0 Video: открытые веса и аудио против закрытого интерактивного превью
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Kandinsky 6.0 Video вышел 6 октября 2026 года, и у него было то, что релизам открытых моделей редко достаётся в первый день: поддержка в Diffusers, ComfyUI, vLLM-Omni, SGLang и FastVideo, вся задокументированная в собственном журнале обновлений репозитория, вместе с отчётом arXiv, отправленным 4 октября, и чекпойнтами под лицензией MIT на Hugging Face. Odyssey-3 появился двумя днями позже, 8 октября, как публичный исследовательский превью авторегрессионного диффузионного трансформера, который строит среду по промпту и предсказывает изменения в реальном времени, пока вы по ней перемещаетесь. Один — это модель с 29 миллиардами параметров, которую можно скачать и запустить на собственной GPU уже сегодня вечером. Другой — интерактивная система, до которой можно добраться только через браузерное превью Odyssey и контактную форму. Это два полюса того, что означало «видеомодель» на одной и той же неделе октября 2026 года, и выбор между ними — не столько о бенчмарках, сколько о том, у кого находятся веса.
Они также хотят от вас разного. {{1}}Kandinsky 6.0 Video{{/1}} — это модель генерации: на входе — промпт, на выходе — пятисекундный клип с синхронизированным звуком. {{2}}Odyssey-3{{/2}} — это модель прогнозирования: действуйте — и наблюдайте, как отвечает мир. Ни одна из них не заменяет другую, и тот факт, что их выпустили с разницей в 48 часов, — самый полезный контекст, который есть у каждой из них.
Две архитектуры, в терминологии самих поставщиков
Kandinsky 6.0 Video — это семейство фундаментальных диффузионных моделей для синхронизированной генерации аудио и видео, включающее Kandinsky 6.0 Video Lite с 3 млрд параметров и Kandinsky 6.0 Video Pro с 29 млрд. Обе генерируют пятисекундные клипы с синхронизированным аудио 44 кГц, включая синхронизацию губ, в режимах текст-аудио-видео и изображение-аудио-видео, а подключаемая модель сверхразрешения повышает разрешение выходного сигнала до Full HD 1920×1080. В основе метода лежит двухпоточная CrossDiT, которая соединяет предварительно обученный видеопоток с заново обученным аудиопотоком через двунаправленное кросс-внимание, так что обе модальности согласуются во времени и семантике, а не генерируются отдельно и мультиплексируются. Схема обучения непрерывна: аудиопоток обучается с нуля на больших аудиокорпусах, затем оба потока обучаются совместно на парных аудиовидеоданных с сохранением унимодальной точности, после чего следуют дообучение с учителем, постобучение с подкреплением и дистилляция.
Odyssey-3 — это авторегрессионный диффузионный трансформер, описываемый Odyssey как многошаговая модель видеодиффузии, расширенная за счёт teacher forcing и причинного маскирования, обученная продолжать с предшествующих наблюдений и предсказывать будущие состояния с обусловливанием на входные действия, а затем дистиллированная с помощью согласования распределений и состязательной дистилляции в вариант с малым числом шагов, достаточно быстрый для взаимодействия. Он работает в разрешении 832×480, а Odyssey-3 Pro — в 1280×720, не создаёт аудио, и вся его цель в том, что его вывод зависит от того, что вы сделали мгновение назад.
Поддержка с первого дня — это та разница, которую никто не замеряет

Прочитайте ещё раз журнал обновлений Kandinsky 6.0, потому что это самый конкретный факт в данном сравнении. 6 октября проект зафиксировал доступность в Diffusers, реестре узлов ComfyUI, vLLM-Omni, SGLang и FastVideo, а также в Hugging Face Space для дистиллированной модели Pro. Это пять независимых стеков инференса за один день. Для любого, кто месяцами ждал, когда чекпойнт доберётся до сервинг-фреймворка, именно это число решает, пригодна ли модель к использованию.
А теперь сопоставьте это с историей доступа Odyssey-3. Превью работает на experience.odyssey.systems, где есть навигация от первого лица, навигация от третьего лица и независимое движение камеры. Доступ к API осуществляется через контактную форму. Нет страницы с ценами, нет документации по лимитам запросов и нет ключа для самостоятельного получения. Условия использования API на сайте были в последний раз обновлены 2026-01-22 и по-прежнему регулируют «прототип Odyssey-2 API» — коммерческая часть не была переписана под модель, выпущенную в этом месяце.
• Где это работает — на ваших собственных GPU, с весами и кодом под MIT, в отличие от Odyssey, где только их серверы.
• Как вы его интегрируете — конвейер Diffusers, узлы ComfyUI, vLLM-Omni, SGLang, FastVideo, в сравнении с браузерным предпросмотром и контактной формой.
• Что можно проверить — архитектуру, методику обучения и размеры контрольных точек в публичном отчёте, по сравнению с описанием процесса обучения от вендора без весов и без статьи.
• Что вы можете изменять — дообученные модели, LoRA-адаптеры, квантизацию и дистилляцию, — всё это сообщество уже публиковало на Hugging Face на следующий день после релиза, в отличие от абсолютно ничего.
Измерение за измерением

• Вывод — пятисекундные клипы с синхронизированным аудио 44 кГц для обоих уровней Kandinsky, в отличие от интерактивной среды без аудио для Odyssey-3.
• Разрешение — Full HD 1920×1080 с помощью плагинной модели суперразрешения для Kandinsky 6.0 Video, против 832×480 у Odyssey-3 и 1280×720 у Odyssey-3 Pro.
• Входные модальности — текст и изображение для Kandinsky, в режимах «текст-аудио-видео» и «изображение-аудио-видео»; промпт плюс ввод живого управления для Odyssey-3.
• Параметры — 3B и 29B опубликованы для уровней Lite и Pro, тогда как для обоих уровней Odyssey-3 они не раскрыты.
• Аппаратное обеспечение — GPU NVIDIA и Python 3.13 или 3.14, с поставляемыми пресетами для карт от H100/H200 до класса RTX 5090 для Kandinsky; браузер для Odyssey-3.
• Цена — $0 за клип для Kandinsky 6.0 Video, если у вас есть GPU, тогда как для Odyssey-3 вообще нет никакой опубликованной цены. Нормализованные оценки стоимости с табло для Odyssey-3 и Odyssey-3 Pro составляют $0.139 и $0.267 за сгенерированное видео без учёта обработки промптов.
• Сторонняя оценка — ни одна из собственных генераций моделей не участвует в независимом прямом сравнении. Отчёт Kandinsky опирается на параллельную оценку людьми в сравнении с его предшественником; показатели Odyssey-3 взяты из заявки на бенчмарк плюс оценка, проведённая производителем.
• Лицензия — MIT для Kandinsky 6.0 Video, в сравнении с отсутствием опубликованной лицензии, потому что нет весов, которые можно было бы лицензировать.
Что говорят и о чем умалчивают бенчмарки
Kandinsky 6.0 Video не фигурирует в Physics-IQ Verified — таблице Anates Labs и DeepMind, которая оценивает продолжения реальных физических экспериментов по 41 модели. Здесь также отсутствует партнёр Odyssey-3 по очному сравнению, потому что таблица оценивает модели, генерирующие клипы, а обе они это делают. Что таблица действительно содержит, так это более раннюю линейку world-model от Kandinsky, Kandinsky-WM 1.0, на 20-м месте и с −8,02 п.п. относительно среднего по треку — другое семейство, другое назначение и единственная запись Kandinsky в таблице.
Для сравнения — строки Odyssey-3: 8-е место при +2,15 п.п. на собственных промптах бенчмарка и $0,129 за видео; 3-е место при +9,99 п.п. на пользовательских промптах, при этом Odyssey-3 Pro занимает второе место в общем зачёте с +11,15 п.п. Это более высокие показатели, чем всё, что есть у линейки Kandinsky в этом конкретном тесте, и к тому же они измеряют другую способность — Odyssey-3 оценивается по тому, что она предсказывает после возмущения, а это именно то, что продаёт её превью.
Собственное доказательство Kandinsky — это человеческая оценка в техническом отчёте: Kandinsky 6.0 Video Pro явно превосходит своего предшественника Kandinsky 5.0 Video Pro и остаётся конкурентоспособным на фоне ведущих моделей генерации аудио и видео, особенно по качеству речи. Это сравнение, проведённое вендором, и именно такое утверждение любой, у кого есть 5090 и несколько свободных часов, может проверить по выпущенному чекпойнту. Аналогичное утверждение Odyssey-3 не может проверить никто без API-ключа.

Достигая их
OrcaRouter не размещает ни одну из этих моделей и никогда не станет утверждать обратное: у Odyssey-3 нет опубликованного тарифа, по которому кто-либо мог бы её маршрутизировать, а Kandinsky 6.0 Video имеет открытые веса, а значит, правильный способ её запуска — собственная настройка из репозитория на вашем собственном GPU, а не размещённый эндпоинт.
То, куда вписывается один ключ OrcaRouter, — это слой вокруг эксперимента. Репозиторий Kandinsky предполагает, что GPU, среду и сравнение предоставляете вы; чего он не предоставляет, так это способа вызывать модели, с которыми вы хотите его сравнивать.Более 200 моделей доступны через единственный ключ OrcaRouter по прейскурантной цене провайдера с наценкой 0% — включая minimax/minimax-h3, видеомодель с открытыми весами, выпущенную MiniMax 31 июля 2026 года, по цене $0,08 за секунду выходного видео в 768P — так что изменение цены у поставщика отражается в вашем счёте в тот же день,автоматическое переключение при сбое не позволяет прогону оценки умереть из-за плохого часа у одного апстрима, а DSL маршрутизации позволяет объединить размещённую видеомодель и модель компьютерного зрения за одним интерфейсом, когда задача состоит в генерации, а затем в оценке. Вы по-прежнему клонируете репозиторий и сами выполняете настройку. Просто вам не нужно собирать вторую половину стенда.
Какой именно тебе нужен
Если вам нужен результат, которым вы можете владеть, — коммерческие условия, которые можно прочитать, веса, которые можно дообучить, пайплайн, работающий, даже если чужой API недоступен, — ответ — Kandinsky 6.0 Video, а поддержка во фреймворках с первого дня означает, что вы не ставите на исследовательский артефакт. Если вам нужен звук в видео, он — единственный из этих двух, который его вообще генерирует.
Если проблема заключается в предсказании, а не в производстве — политика, которая должна реагировать, среда обучения, что-либо, где следующее состояние зависит от последнего действия — Odyssey-3 — единственный из двух, который это делает, и он же тот, который нельзя купить. Вот честная картина этого противостояния на неделе, когда оба вышли: открытая модель, которую можно скачать, и интерактивная модель, которую можно только попробовать, при этом свидетельства бенчмарков в пользу закрытой, а практические свидетельства в пользу открытой.
