Мультимодальная hero-карточка Claude Opus 5.5: название модели поверх сгенерированной титульной карточки.
Guides & Insights

Мультимодальный Claude Opus 5.5: рендерит видео из кода, но не может посмотреть ни одного

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Попросите Claude Opus 5.5 сделать видео — и вы вполне можете его получить: программу из HTML, CSS или вызовов canvas, которая отрисовывает каждый кадр, а затем вы её запускаете. Дайте ей видео и спросите, что в нём происходит, — и вы не получите ровным счётом ничего, потому что ввода видео нет. Эта асимметрия и составляет всю модальную поверхность данной модели, и она одинакова у всех одиннадцати моделей Anthropic в нашей таблице, так что стоит сказать прямо: Claude Opus 5.5 читает текст, изображения и файлы, пишет текст — и на этом всё. А вот модели вокруг неё куда менее однородны. MiniMax H3 сам генерирует видео, OrcaDub 1.0 принимает видео на вход и возвращает дублированное, а Qwen3.8-Max посмотрит клип за два доллара за миллион входных токенов — вдвое меньше, чем Claude Opus 5.5 берёт за тот же миллион, и с возможностью, которой у неё нет.

Это срез строки модальности в том виде, в каком OrcaRouter фиксирует её на 2026-09-29, по всем 204 моделям в каталоге. Приведённые ниже числа — это декларации из каталога, а не наши бенчмарки; поле модальности — это то, что указано в карточке модели, а карточки моделей меняются.

Что каталог фактически фиксирует

Из 204 моделей 182 указывают входную поверхность. Остальные 22 оставляют это поле пустым, что является утверждением о записи, а не о модели, — среди них восемь видеомоделей Kling, четыре метамодели OrcaRouter и несколько разрозненных эндпоинтов бесплатного уровня и предварительного просмотра.

A horizontal bar chart of declared input modalities across the OrcaRouter catalogue: 131 models read images, 77 read files, 49 read video, 19 read audio, and 50 take text only.

Среди этих 182:

• 131 прочитанных изображений

• 77 читают файлы — и каждый из этих 77 также читает изображения, поэтому ввод файлов на этом табло является усилением ввода изображений, а не отдельной шестой модальностью

• 49 прочитанных видео

• 19 прослушать аудио

• 50 возьмите текст и ничего больше

Claude Opus 5.5 работает с изображениями и файлами, но не с видео. На нашей собственной странице модели об этом сказано в одном предложении, под заголовком «Контекст, модальности и мышление»: мультимодальный ввод — текст, изображения и файлы — с текстовым выводом, окном контекста в 1 млн токенов и выводом объёмом до 128 тыс. токенов. Это и есть полный набор входных данных. Никакого пятого пункта, скрытого в подменю, нет.

Пятьдесят — это больше, чем ожидает большинство людей. Более четверти моделей, которые вообще что-либо заявляют, принимают только текст, а значит, конвейер, построенный в расчёте на то, что можно прикрепить скриншот и его поймут, сломается на четверти этого борда.

Почему «видео с кодом» не является видеомодальностью

Демо, которые разошлись по сети, — настоящие, и эффект тоже: Claude Opus 5.5 необычайно хорошо пишет программу, которая рисует движение, — самодостаточный рендерер, выдающий кадры при запуске. Это реальная и полезная способность. А вот модальностью вывода это не является. В каталоге для этой модели зафиксирован ровно один вывод, и это текст. Видео создаётся дальше по цепочке — кодом, который написала модель, на вашей машине, вашим рендерером.

Практическое следствие имеет две стороны, и люди обычно упускают именно вторую половину.

На выходе этап рендеринга — на вашей ответственности. Видео на основе кода можно инспектировать, сравнивать через diff и повторно запускать в другом разрешении, и оно дёшево так же, как дёшев текстовый ответ, — несколько долларов за токены вместо посекундного счётчика оплаты. Вы также отвечаете за каждую ошибку: отсутствующий шрифт, неверный бюджет кадра, рендерер, который расходится с переданным ему кодом.

На входе ему нечего передать. Если ваш исходный материал — запись экрана, продуктовый клип, двухчасовой вебинар или рекламный фильм о запуске конкурента, Claude Opus 5.5 не может его посмотреть. Вы можете отправить только транскрипт, слайды в виде стоп-кадров или описание, написанное кем-то другим. Именно это ограничение и определяет по-настоящему архитектуру, и его не видно в демо-ролике.

Два лагеря: 60 моделей берут документ, 29 — клип.

Сгруппируйте 182 модели по их точному набору входных данных, и табло распадётся на две группы, которые почти не пересекаются.

Лагерь A — документы и изображения, без видео: 60 моделей. Медианная цена ввода $2,00 за миллион токенов. Именно здесь Claude Opus 5.5 находится в одном ряду со всеми одиннадцатью моделями Anthropic, тремя из пяти строк Grok и рассуждающим краем каталога OpenAI — каждой строкой GPT-4.1 и GPT-6, а в семействах GPT-4o и GPT-5 всем, кроме вариантов voice, codex, search и chat-latest. Лагерь A также удерживает верхнюю границу прайс-таблицы: openai/gpt-5.5-pro openai/gpt-5.4-pro по $30 за миллион входных токенов. Это самая высокая цена ввода во всей таблице, и её они делят с двумя строками OpenAI GPT-4 и двумя эндпоинтами преобразования текста в речь, ни один из которых не читает документы. И ни один из этих восьми не умеет смотреть видео.

Лагерь B — текст, изображения и видео, без файлов: 29 моделей. Медианная цена ввода $0.25 за миллион токенов. Двадцать две из двадцати девяти имеют префикс Qwen; остальные — MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B и две сборки Qwen, настроенные под Obsidian. Его потолок — Qwen3.8-Max при $2.00 за миллион, то есть самая дорогая модель для чтения видео в этом лагере стоит ровно половину стоимости Claude Opus 5.5.

Медианный разрыв между лагерями составляет 8×. Разрыв по составу ещё более резкий. Из 182 моделей, которые заявляют входную поверхность, 60 принимают документы, но не видео, 32 принимают видео, но не документы, 73 не принимают ни то, ни другое, и только 17 принимают и то, и другое. Пересечение настолько мало, что эти две группы читаются как почти непересекающиеся продукты, а 17 в середине — почти целиком верхний эшелон Google — пятнадцать из семнадцати — плюс две сборки Meta Muse Spark.

A comparison scoreboard contrasting the two catalogue camps: 60 document-and-image models at a median $2.00 per million input tokens against 29 video-and-image models at a median $0.25 per million.

У этой формы есть правдоподобное объяснение. Понимание документов и понимание видео — разные инженерные задачи с разными кривыми затрат, и поставщики, которые первыми решили задачу видео, в основном продают дешёвые токены сотнями миллионов. Поставщики, которые первыми решили задачу документов, продают рассуждения по премиальной цене. Никого пока не вынуждали делать и то, и другое по одной и той же цене, поэтому рынок разделился на два продукта и установил на них соответствующие цены.

Девятнадцать, которые забирают всё

Девятнадцать моделей принимают все четыре типа входных данных — текст, изображение, видео и аудио. Две — от Google, две — от Meta, одна — от MiniMax. Собственный диапазон Google в этом лагере простирается от $0.10 за миллион для gemini-2.5-flash-lite до $4.00 для gemini-pro, и «читает всё» — это не ценовой уровень; это решение, которое Google принял на каждой ценовой точке. Вклад Meta — пара сборок Muse Spark — Muse Spark 1.1 и Muse Spark 1.2, идентичных в каталоге: $1.25 за миллион на входе и $4.25 на выходе, с контекстом в 1M токенов.

Это тот лагерь, который подтверждает главный тезис статьи: пайплайну, учитывающему видео, не нужна флагманская модель. Нужно лишь выбрать из списка из девятнадцати — десять из которых стоят меньше доллара за миллион входных токенов.

Пять моделей на этой доске выдают что-то отличное от текста.

Читать видео и создавать его — разные умения, и второе встречается реже. Из 204 моделей 139 заявляют о выходной поверхности; пять из них называют нечто иное, чем текст.

Три из них — генераторы изображений: Nano Banana (Gemini 2.5 Flash Image) по $0.30 за вход и $30.00 за выход за миллион токенов, Nano Banana Pro (Gemini 3 Pro Image Preview) по $0.24 за запрос, и Nano Banana 2 (Gemini 3.1 Flash Image Preview) по $0.151 за запрос. Две генерируют видео: MiniMax H3, оплачивается посекундно за сгенерированный вывод — $0.08 в секунду при 768P и $0.13 при 2K, для клипов длительностью от четырёх до пятнадцати секунд с нативным стереозвуком — и OrcaDub 1.0, оплачивается по $0.60 за минуту исходного видео, охватывает 28 языков и клонирует отдельный голос для каждого говорящего.

Здесь следует избегать двух трактовок. Во-первых, в оставшихся 65 строках поле вывода остаётся пустым; пустое значение означает, что каталог не фиксирует выходную поверхность, и это не свидетельствует о том, что модель выдаёт только текст. Во-вторых, чтение видео и создание видео — это отдельные оси, которые почти не пересекаются в этой таблице — OrcaDub 1.0 принимает видео на вход и возвращает видео, что делает её единственной моделью здесь, которая, по-видимому, находится на обоих концах конвейера, тогда как MiniMax H3 принимает четыре типа входных данных, чтобы выдать один тип выходных данных, не являющийся текстом.

Что куда маршрутизировать

Из переписи вытекают четыре правила, и они дёшевы в применении.

• Если на входе у вас видеоклип, не хватайтесь сразу за передовой флагман. Лагерь, который читает видео без необходимости в документах, — это 29 моделей, двадцать две из них Qwen, а его медиана — четверть доллара за миллион. Вместо этого отправьте флагману кадры и транскрипт и позвольте ему выполнить рассуждение.

• Если ваш ввод — это PDF, договор или длинный документ, видеолагерь — не тот лагерь.Только 17 моделей заявляют одновременно файловый и видео ввод, и каждая модель, заявляющая файловый ввод, также заявляет ввод изображений, поэтому эти двое идут рука об руку.Claude Opus 5.5 за $4.00 за миллион покупает работу с документами плюс окно в 1 млн токенов — вот на какой компромисс вы идёте.

• Если вам нужен вывод медиа, вы выбираете из пяти моделей, а не из всего набора. Три создают статичные изображения, а две — видео, причём эти две тарифицируются по секундам и минутам, а не по токенам, — поэтому оценка стоимости, построенная на ценах за входные данные, будет ошибочной по определению.

• Если вам нужен видеовыход, а исходник — это сценарий, генерация кода остаётся самым дешёвым путём в этом сравнении. Claude Opus 5.5пишет рендерер по цене текста; MiniMax H3рендерит его за восемь центов в секунду. Связка этих двух обходится дешевле любой из альтернатив и оставляет вам файл, который можно редактировать.

Часто задаваемые вопросы

Может ли Claude Opus 5.5 смотреть видео?

Нет. Его заявленные входные модальности — текст, изображение и файл. Видео среди них нет, как и аудио. Запись экрана или продуктовый клип должны быть преобразованы — выбранные кадры, транскрипт или и то, и другое — прежде чем их можно будет отправить.

Генерирует ли Claude Opus 5.5 видео напрямую?

Не как модальность. Она возвращает текст, и этот текст часто представляет собой самодостаточную программу, которая воспроизводит движение при запуске. Рендеринг выполняете вы; модель не выдаёт ни одного пикселя. Если вам нужна модель на этой доске, которая сама возвращает видео, MiniMax H3 и OrcaDub 1.0 — это те две.

Является ли «multimodal» ценовым уровнем?

Нет, и таблица показывает почему — в обоих направлениях. Google предлагает полную четырёхмодальность на входе — от $0,10 до $4,00 за миллион входных токенов, тогда как одна из самых высоких цен на входе в таблице — openai/gpt-5.5-pro по $30 за миллион — читает документы и изображения, но не видео. Вы платите за уровень рассуждений, а не за количество модальностей.

Почему так мало моделей читают документы, если так много читают изображения?

Поскольку на этом табло файлы и изображения идут рука об руку: все 77 моделей, читающих файлы, также читают изображения, поэтому ввод файлов — это расширение ввода изображений, а не независимая возможность. Число, которое стоит запомнить: 60 из 182 моделей, заявляющих о поддержке входных данных, принимают документы и изображения и совсем не поддерживают видео — это треть табло, и именно там располагается флагманский уровень.

Как мне назначить цену на видеопайплайн?

В зависимости от единицы, в которой тарифицируется модель. Видеочитатели тарифицируются за токен, как и любая чат-модель. Видеогенераторы в этом списке тарифицируются за секунду выходного видео (MiniMax H3: $0,08 при 768P, $0,13 при 2K) или за минуту исходного материала (OrcaDub 1.0: $0,60). Смешивание этих двух единиц в одной смете — самый распространённый способ ошибиться в бюджете на видео.

Строка, которую нужно запомнить

Интересное в Claude Opus 5.5не в том, что он мультимодален. Большинство моделей в линейке — тоже. А в том, что граница модальностей проходит в необычном месте — документы и статичные изображения на входе, текст на выходе, никакого видео ни в одну, ни в другую сторону, — тогда как демо, которые его прославили, это видео. Эти два факта не противоречат друг другу, и именно восприятие их как противоречия делает историю про «код-видео» запутанной. Модель пишет рендерер; рендерер создаёт фильм. На вход модели можно подать сценарий, документ и скриншот.

The OrcaRouter model page for Claude Opus 5.5, showing the Context, modalities and thinking section with text, image and file input, text output, a 1M-token context window and up to 128K output tokens.

Всё выше — это снимок каталога OrcaRouter по состоянию на 2026-09-29 и содержащихся в нём деклараций модальностей. Спецификации вендоров меняются, и список модальностей в карточке модели — первое, что нужно перепроверить, прежде чем опираться на какое-либо число. Если какое-либо утверждение здесь важно для решения, откройте страницу модели — нужные поля есть на ней.