
Odyssey-3: новая модель мира Odyssey завоевывает корону Physics-IQ и открывает публичный предпросмотр
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Odyssey-3 Pro получила оценку 66,1 в треке video-to-video Physics-IQ Verified, и Odyssey опубликовала это число 8 октября 2026 года рядом с тем, что действительно важно для разработчика: публичным исследовательским превью Odyssey-3 — авторегрессионного диффузионного трансформера, созданного для того, чтобы генерировать окружение по промпту, а затем продолжать предсказывать его в реальном времени, пока кто-то перемещается по нему, двигает камеру или запускает событие. Odyssey-3 — это модель; Odyssey-3 Pro — её 720p-уровень, работающий в разрешении 1280×720 против 832×480 у базовой модели. Оба появляются в один день в превью, которым вы можете управлять сами на experience.odyssey.systems, с отдельным каналом связи для доступа к API.
Именно это сочетание делает данный материал не просто постом о бенчмарке. Интерактивные модели мира уже два года остаются демо-игрушками; те, что генерируют несколько кадров правдоподобного движения по фиксированной траектории, — это не тот же артефакт, что модель, которая сохраняет согласованность своих предсказаний после того, как вы подёргаете управление. Odyssey заявляет именно второе и позволяет любому проверить это заявление.
Что именно было выпущено
Две контрольные точки, одна архитектура, без весов.
• Odyssey-3 — уровень 480p, выход 832×480, 16 fps на тестовом стенде, в столбце нормализованной стоимости таблицы лидеров указана цена $0.139 за сгенерированное видео.
• Odyssey-3 Pro — уровень 720p, 1280×720, указан по цене $0,267 за видео на той же основе.
• Доступ — это исследовательский предпросмотр в браузере с навигацией от первого лица, навигацией от третьего лица и независимым управлением камерой. Доступ к API осуществляется через контактную форму, а не через ключ, получаемый самостоятельно.
• Открытость — отсутствует. Ни весов, ни лицензии, ни цены за токен не опубликовано. Страница условий API на том же сайте была в последний раз обновлена 2026-01-22 и по-прежнему регулирует «прототип Odyssey-2 API», что говорит о том, насколько нова коммерческая составляющая.
Архитектура описывается в собственном материале Odyssey как многошаговый видеодиффузионный трансформер, расширенный авторегрессионно с помощью teacher forcing и причинного маскирования, с пайплайном постобучения, который объединяет согласование распределений и состязательную дистилляцию в дистиллированный вариант с несколькими шагами — именно та часть, которая вообще делает возможным взаимодействие в реальном времени. Диффузия даёт достоверность; авторегрессия даёт модель, которая выдерживает последовательность действий; дистилляция даёт тактовую частоту. Все три — несущие элементы, и все три — это рассказ вендора о собственной системе, а не независимое описание.
Бенчмарк, прочитанный так, как его на самом деле читает совет директоров
![The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.](https://cms.orcarouter.ai/api/media/file/2-1765.png)
Physics-IQ Verified проводится компанией Anates Labs совместно с DeepMind, и это действительно неудобный для накрутки бенчмарк: он показывает моделям видео реальных физических экспериментов — гидродинамика, оптика, механика твёрдого тела, магнетизм, термодинамика — и оценивает продолжение относительно того, что произошло на самом деле. В настоящее время в его рейтинге 41 модель из 16 лабораторий. 66,1 балла Odyssey-3 Pro — это наивысший сырой балл на треке видео-в-видео, о котором сообщает Odyssey, а колонка чистого улучшения на той же доске, которая измеряет прирост над средним значением по треку в процентных пунктах, рассказывает несколько иную историю:
• Чистый прирост относительно среднего значения по треку — FLUX 3 [large] лидирует с +12.27 п.п.; Odyssey-3 Pro занимает второе место с +11.15 п.п.; Odyssey-3 — третье с +9.99 п.п.
• Стоимость за одно сгенерированное видео — Odyssey-3 Pro $0.267, Odyssey-3 $0.139, по сравнению с FLUX 3 [large] за $0.868 и Seedance 2.5 за $2.838. (Стоимости нормализованы к 24 fps и выходному разрешению шириной 1280 там, где это возможно для таблицы лидеров, поэтому они сопоставимы между моделями с разной частотой кадров.)
• Лидерство по субметрикам — Odyssey-3 занимает первое место по пространственно-временной субметрике с показателем 44,70, опережая Odyssey-3 Pro с 42,97; FLUX 3 [large] выходит на первое место по пространственной субметрике с 64,36 и по взвешенной пространственной с 53,25, тогда как обе модели Odyssey занимают второе и четвёртое места по пространственной субметрике.
Итак, честное прочтение таково: «Odyssey-3 — лучшая видеомодель в мире» — это неверно. Верно другое: модель мира, созданная для взаимодействия, оказалась near the top of a physical-plausibility board, которая ранее была вотчиной кинематографичных генераторов, и сделала это примерно при трети нормализованной стоимости FLUX 3. Отдельное заявление Odyssey — 54,7 для Odyssey-3 Pro на треке image-to-video, best-of-8 — относится к той же таблице, и к нему применима та же оговорка: это самостоятельно отправленные конфигурации, а лидерборд смешивает записи, отправленные с пользовательскими промптами, и записи, запущенные на собственных промптах бенчмарка. Odyssey присутствует в обоих столбцах, что необычно прозрачно и также означает, что две её строки измеряют не одно и то же.

Почему «модель мира» — не синоним «видеомодели»
Это различие — суть всего продукта, поэтому о нём стоит сказать прямо. Генератор клипов берёт промпт и возвращает фиксированный объект; результат одинаков для всех, кто его запрашивает. Odyssey-3 берёт промпт и возвращает систему, внутри которой вы действуете, — режимы камеры от первого и третьего лица в предпросмотре и её способность принимать событие в середине генерации — это механизм, с помощью которого она предсказывает, что произойдёт дальше, исходя из того, что вы только что сделали, а не из того, что было сказано в промпте.
Именно это свойство определяет, как выглядят результаты по физическим системам в материалах к запуску Odyssey. Компания сообщает, что декодер действий, прикреплённый к замороженной модели мира и обученный на десятках часов демонстраций роботов, породил восстановительные поведения, которых никогда не было в демонстрациях — переориентацию захвата после неудачного схватывания, подбор объекта, упавшего в необычной ориентации. Она сообщает о гуманоидной политике, построенной Flexion на базе Odyssey-3 с использованием десятков часов данных телеоперации, которая продолжала выполняться при изменениях освещения, ломавших базовые модели VLA, с которыми её сравнивали. Она сообщает о политике вождения, обученной на 20 часах симулированных данных, которая управляла в замкнутом контуре на реальных дорогах, проезжая примерно 77% того же расстояния между вмешательствами водителя безопасности, что и политика, обученная на реальных видеоматериалах. Она сообщает о навигации дрона на основе симулированных данных полёта и об игровом процессе в GTA V, который перенёс движение в Red Dead Redemption 2, а езду на мотоцикле — в Sleeping Dogs, без дополнительного обучения.
Каждый из них — это результат, заявленный производителем, без независимой репликации, а два из них Odyssey явно позиционирует как качественные наблюдения, а не измерения. Но для этого утверждения это именно тот тип доказательств, который нужен: интересно не то, что модель умеет выполнять задачу, для которой её обучали. А то, что замороженный бэкбон плюс небольшой адаптер позволяет получить осмысленное поведение из нескольких десятков часов данных и иногда обобщает за их пределами.
Что всё ещё не доказано

Три вещи, и они не маленькие.
Во-первых, ни один независимый оценщик не запускал Odyssey-3. Запись в Physics-IQ — это заявка, а второй источник оценок в собственном отчёте Odyssey — WorldMark, в котором Odyssey-3 занимает первое место в трёх из четырёх сплитов, — это оценка вендора, использующая собственные подписи бенчмарка и, по формулировке Odyssey, «среднее из его 13 заявленных метрических оценок». Это компания оценивает саму себя на чужом наборе данных. Это больше, чем предлагает большинство запусков. Но это не третья сторона.
Во-вторых, та единственная категория, в которой Odyssey-3 не побеждает в этой оценке, — это категория, ближе всего соответствующая маркетинговому утверждению. В реалистичных средах от первого лица он занимает третье место с 80,6, уступая Lyra 2.0 с 84,4 и AlayaWorld с 83,0. Преимущество модели в той же оценке сосредоточено в стилизованных средах и средах от третьего лица — 77,2 в стилизованных от первого лица, 79,0 в реалистичных от третьего лица, 76,3 в стилизованных от третьего лица. Если вы создаёте решение для фотореалистичного воплощения от первого лица, рейтинг, который вас должен волновать, — это тот, где Odyssey-3 не на первом месте.
В-третьих, доступность. «Research preview» в этом предложении несёт реальную смысловую нагрузку. Нет страницы с ценами, нет документации по ограничениям частоты запросов и нет ключа для самостоятельного получения. Если вы хотите использовать это в продукте, вы стоите в очереди.
Сравнение этого без второго контракта
Вот в чём практическая проблема с таким запуском: Odyssey-3 — самое интересное в генерации видео на этой неделе, а вызвать его всё ещё нельзя. А вот модели, с которыми вы бы на самом деле стали его сравнивать, — совсем другая история.
OrcaRouter не размещает Odyssey-3, и даже если бы размещал, опубликованной цены, которую можно было бы передать, не существует. Что действительно открывает один ключ — так это остальную часть набора для сравнения: minimax/minimax-h3 по цене $0,08 за секунду сгенерированного видео в 768P, линейку видео Kling и более 200 моделей за одним эндпоинтом — по каталожной цене провайдера с наценкой 0%, так что изменение цены у вендора отражается в вашем счёте в тот же день, а не при следующем продлении. Автоматическое переключение при сбое между провайдерами означает, что серия оценок не погибнет из-за того, что у одного апстрима выдался неудачный день, а DSL маршрутизации позволяет поставить несколько моделей за одним интерфейсом, так что очное сравнение — это изменение конфигурации, а не вторая интеграция. Если Odyssey откроет self-serve API, именно в такую форму вы и захотите его встроить.
Что бы это уладило
Независимый прогон Odyssey-3 на стенде, который она не выбирала. Дюжина практикующих специалистов с доступом к предпросмотру, описывающих, где среда держится после минуты агрессивной работы с камерой, а где — нет. Цена. Любой из этих пунктов превращает это из сильного запуска в точку отсчёта.
То, что уже верно, — это более узкий, но всё же примечательный факт: на единственном публичном рейтинге, который измеряет, понимает ли генеративная модель физику, а не то, насколько хорошо она фотографирует, модель, назначение которой — взаимодействие, занимает второе и третье места, при нормированной стоимости ниже, чем у модели на первом месте.
