Claude Opus 5.5 マルチモーダルヒーローカード:生成されたタイトルカードの上にモデル名を重ねたもの。
Guides & Insights

Claude Opus 5.5 Multimodal:コードから動画をレンダリングできるのに、動画を観ることはできない

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

動画をClaude Opus 5.5に頼むと、動画が手に入ることがあります — HTML、CSS、あるいはcanvas呼び出しによるプログラムで、1フレームずつ描画し、それをあなたが実行するのです。動画を渡して中で何が起きているか尋ねても、まったく何も返ってきません。動画入力が存在しないからです。この非対称性こそがこのモデルのモダリティ領域のすべてであり、私たちのボード上の11のAnthropicモデルすべてで同一なので、はっきり言っておく価値があります:Claude Opus 5.5はテキスト、画像、ファイルを読み、テキストを書き、そこで終わりです。その周りのボードはずっと均一ではありません。MiniMax H3は動画をそのまま生成し、OrcaDub 1.0は動画を受け取って吹き替え版を返し、Qwen3.8-Maxは入力トークン100万あたり2ドルでクリップを視聴します — 同じ100万トークンに対してClaude Opus 5.5が請求する額の半分で、しかもそれにはない能力を備えています。

これは、OrcaRouter が 2026-09-29 時点で記録しているモダリティ行を、カタログ内の全 204 モデルについて読み取ったものです。以下の数値はカタログ上の宣言であり、当社のベンチマークではありません — モダリティフィールドとはモデルカードに書かれている内容のことであり、モデルカードは変わり得ます。

カタログが実際に記録しているもの

204 のモデルのうち、182 が入力サーフェスを宣言している。残りの 22 はそれを空欄にしており、これはモデルについてではなく記録についての記述だ — その中には 8 つの Kling 動画モデル、4 つの OrcaRouter メタモデル、そして無料枠やプレビューのエンドポイントが散在している。

A horizontal bar chart of declared input modalities across the OrcaRouter catalogue: 131 models read images, 77 read files, 49 read video, 19 read audio, and 50 take text only.

その182件を通じて:

• 131件の画像を閲覧

• 77件がファイルを読み取る — そしてその77件はいずれも画像も読み取るため、このボードにおいてファイル入力は画像入力の強化であり、決して独立した第六のモダリティではない

• 49件の動画を閲覧済み

• 19 音声を聞く

• 50 テキストだけを取り、他には何も

Claude Opus 5.5は画像とファイルのライン上にあり、動画のライン上にはありません。私たち自身のモデルページでは、「コンテキスト、モダリティ、思考」という見出しの下で、それを一文で述べています。マルチモーダル入力 — テキスト、画像、ファイル — とテキスト出力、100万トークンのコンテキストウィンドウ、最大128Kの出力トークン。それが入力サーフェスのすべてです。サブメニューに隠れた5番目の項目はありません。

50は、ほとんどの人が思うより大きな数だ。何らかの宣言をしているモデルだけでも、4分の1以上がテキストのみを受け付ける。つまり、スクリーンショットを添付すれば理解されると想定して組まれたパイプラインは、このボードの4分の1で破綻することになる。

「コード付き動画」が動画モダリティではない理由

出回ったデモは本物であり、その効果も本物だ:Claude Opus 5.5は、動きを描くプログラム——実行するとフレームを生成する自己完結型のレンダラー——を書くのが異常なほど得意だ。それは本物の能力であり、有用なものでもある。だがそれは出力モダリティではない。カタログがこのモデルについて記録している出力はちょうど一つだけで、それはテキストだ。動画は下流で、モデルが書いたコードによって、あなたのマシン上で、あなたのレンダラーを使って作られるものである。

実用的な帰結はどちらにも作用する。そして、人が見落としがちなのはその後半のほうだ。

出力の段階では、レンダリングステップはあなたが担います。コードベースの動画は検査可能で、差分比較可能で、異なる解像度で再実行可能であり、テキスト応答が安価であるのと同じように安価です — 秒単位の課金メーターではなく、数ドル分のトークンです。また、あらゆる失敗もあなたの責任です:フォントの欠落、フレームバジェットの不良、渡されたコードと一致しないレンダラー。

入力の段階では、渡せるものが何もない。素材がスクリーン録画、製品クリップ、2時間のウェビナー、競合のローンチ映像であっても、Claude Opus 5.5はそれを見ることができない。送れるのは文字起こし、静止画にしたスライド、あるいは誰かが書いた説明だけだ。これこそが実際にアーキテクチャを決める制約であり、デモリールでは見えない。

二つの陣営:60モデルは文書を、29モデルはクリップを取る

182個のモデルを正確な入力セットでグループ分けすると、ボードはほとんど重ならない2つのグループに分かれる。

キャンプA — ドキュメントと画像、動画なし:60モデル。入力価格の中央値100万トークンあたり$2.00。ここに位置するのがClaude Opus 5.5であり、Anthropicの11モデルすべて、Grokの5行のうち3行、そしてOpenAIカタログの推論系 — GPT-4.1とGPT-6の全行、さらにGPT-4oとGPT-5ファミリーではvoice、codex、search、chat-latestの各バリアントを除くすべてが並ぶ。キャンプAは価格表の上限も占めている:openai/gpt-5.5-proとopenai/gpt-5.4-proが100万入力トークンあたり$30だ。これはボード全体で最も高い入力価格であり、OpenAIのGPT-4の2行と2つのテキスト読み上げエンドポイントと共有している価格でもあるが、それらのいずれもドキュメントを読むことはない。この8つのうち動画を見られるものは一つもない。

Camp B — テキスト、画像、動画、ファイルなし:29モデル。 入力価格の中央値 100万トークンあたり0.25ドル。29モデルのうち22モデルがQwenの接頭辞を持ち、残りはMiniMax M3、GLM-5.3-Flash、Kimi K2.6、Kimi K2.7-Code、Gemma 4 26B、そしてObsidian向けに調整されたQwenビルド2つだ。その上限はQwen3.8-Maxの100万トークンあたり2.00ドル——つまり、このCampで最も高価な動画読み取りモデルは、Claude Opus 5.5のちょうど半分のコストだということになる。

两阵营之间的中位差距是8×。成员构成差距更加明显。在182个声明了输入界面的模型中,60个接受文档而不接受视频,32个接受视频而不接受文档,73个两者都不接受,只有17个两者都接受。重叠部分小到足以让这两个群体看起来几乎是互不相干的产品,而中间的那17个几乎全部来自谷歌的上层——十七个中有十五个——再加上Meta的两个Muse Spark构建。

A comparison scoreboard contrasting the two catalogue camps: 60 document-and-image models at a median $2.00 per million input tokens against 29 video-and-image models at a median $0.25 per million.

その形にはもっともらしい理由がある。文書理解と動画理解は、異なるコスト曲線を持つ別個のエンジニアリング上の問題であり、動画を先に解決したベンダーは、たいてい、安価なトークンを億単位で売っている連中だ。文書を先に解決したベンダーは、推論をプレミアム価格で売っている連中だ。まだ誰も、同じ価格で両方を提供することを強いられていない。だから市場は2つの製品に分裂し、それに応じて値付けされている。

すべてを奪い去る19人

19のモデルが4種類の入力タイプ——テキスト、画像、動画、音声——すべてに対応している。16がGoogle、2がMeta、1がMiniMaxだ。その中のGoogle自身の価格帯は100万トークンあたり$0.10のgemini-2.5-flash-liteから$4.00のgemini-pro-latestまでに及び、つまり「何でも読める」は価格帯ではない。Googleがあらゆる価格ポイントで下した判断なのだ。Metaの貢献はMuse Sparkビルドの2つ——Muse Spark 1.1とMuse Spark 1.2で、カタログ上は同一、入力100万トークンあたり$1.25、出力$4.25、コンテキストは1Mトークン。

これがこの記事の実質的な要点を成立させている立場だ。動画対応パイプラインに旗艦モデルは必要ない。必要なのは19の候補リストから選ぶことで、そのうち10は入力トークン100万あたり1ドル未満で済む。

このボード上の5つのモデルは、テキスト以外のものを出力する。

動画を読むことと作ることは別の技であり、後者のほうが珍しい。204のモデルのうち、139が出力サーフェスを宣言しており、そのうち5つはテキスト以外のものを挙げている。

3つは画像生成器です:Nano Banana(Gemini 2.5 Flash Image)は入力100万トークンあたり$0.30、出力100万トークンあたり$30.00、Nano Banana Pro(Gemini 3 Pro Image Preview)はリクエストあたり$0.24、そしてNano Banana 2(Gemini 3.1 Flash Image Preview)はリクエストあたり$0.151です。2つは動画を出力します:MiniMax H3は生成出力の秒単位で課金され、768Pでは1秒あたり$0.08、2Kでは$0.13で、4~15秒のクリップにネイティブステレオ音声付き、そしてOrcaDub 1.0は元動画1分あたり$0.60で課金され、28言語に対応し、話者ごとに別々の音声をクローニングします。

ここで避けるべき二つの捉え方がある。第一に、残りの65行は出力フィールドを空欄のままにしている。空欄とは、カタログが出力サーフェスを記録していないという意味であり、モデルがテキストのみを出力する証拠ではない。第二に、動画を読むことと動画を作ることは別個の軸であり、このボード上ではほとんど重ならない——OrcaDub 1.0は動画を入力として受け取り、動画を返す。つまり、ここで唯一、パイプラインの両端に同時に位置し得るモデルであり、一方でMiniMax H3は4種類の入力タイプを受け取り、テキストではない単一の出力タイプを生成する。

何をどこにルーティングするか

調査からは4つのルールが導き出され、しかもその適用は容易だ。

• 入力がクリップなら、まずフロンティアのフラッグシップに手を伸ばす必要はない。ドキュメントを必要とせずに動画を読み取る陣営は29モデルで、そのうち22がQwen、中央値は100万あたり25セントだ。代わりにフラッグシップにフレームと文字起こしを送り、推論を任せよう。

• 入力がPDF、契約書、または長い文書である場合、ビデオ系は適切ではありません。ファイル入力とビデオ入力の両方を宣言しているモデルは17個だけで、ファイル入力を宣言しているモデルはすべて画像入力も宣言しているため、この2つは常にセットで扱われます。Claude Opus 5.5は100万トークンあたり$4.00で、文書対応サーフェスと100万トークンのウィンドウを提供しており、これがあなたが選ぶトレードオフです。

• メディア出力が必要なら、選ぶのはボードからではなく5つのモデルからです。3つは静止画を生成し、2つは動画を生成します。その2つはトークン単位ではなく秒単位・分単位で課金されるため、入力価格から構築したコスト見積もりは構造的に誤りとなります。

• 動画出力が必要で、ソースが脚本なら、コード生成がこのボードで最も安いルートであり続けます。 Claude Opus 5.5はテキスト並みの価格でレンダラーを書きます;MiniMax H3は1秒8セントでそれをレンダリングします。2つを連結すると、どちらの代替手段よりもコストが低く、編集可能なファイルが手元に残ります。

よくある質問

Claude Opus 5.5は動画を視聴できますか?

いいえ。宣言されている入力モダリティは、テキスト、画像、ファイルです。動画はそれらに含まれておらず、音声も含まれていません。画面収録や製品クリップは、送信できるようになる前に、変換する必要があります — サンプリングされたフレーム、文字起こし、またはその両方に。

Claude Opus 5.5は動画を直接生成しますか?

モダリティとしてではない。テキストを返し、そのテキストは実行するとレンダリングする自己完結型プログラムです。レンダリングはあなたのもので、モデルは1ピクセルも出力しません。この中で動画そのものを返すモデルが欲しいなら、MiniMax H3とOrcaDub 1.0がその2つです。

「マルチモーダル」は料金プランの階層ですか?

いや、ボードが双方向でその理由を示している。Googleは4入力すべてに対応したマルチモーダルを、入力100万トークンあたり$0.10から$4.00で提供している。一方、ボード上で最高タイの入力価格であるopenai/gpt-5.5-proの100万トークンあたり$30は、文書と画像は読めるが動画は読めない。あなたが支払っているのは推論のティアであって、モダリティの数ではない。

なぜ、画像を読むモデルはこんなに多いのに、文書を読むモデルはこんなに少ないのでしょうか?

このボードではファイルと画像が一緒に扱われるため、ファイルを読む77モデルはすべて画像も読む。つまりファイル入力は独立した能力ではなく、画像入力の拡張だ。覚えておきたい数字は、入力サーフェスを公称する182モデルのうち60が文書と画像を受け付け、動画は一切扱わないということだ。これはボードの3分の1にあたり、フラッグシップ層が位置する領域でもある。

動画パイプラインの価格はどう設定すればよいですか?

モデルがどの単位で課金するかによって決まります。動画リーダーは、他のチャットモデルと同様にトークン単位で課金されます。このボード上の動画ジェネレーターは、出力1秒あたり(MiniMax H3:768Pで$0.08、2Kで$0.13)またはソース1分あたり(OrcaDub 1.0:$0.60)で課金されます。この2つの単位を1つの見積もりに混ぜてしまうことが、動画の予算が狂う最も一般的な原因です。

覚えておきたい一言

興味深いのは、Claude Opus 5.5がマルチモーダルであることではない。ボードの大半はそうだ。興味深いのは、モダリティの境界線が普通とは違う場所にあることだ——文書と静止画像が入力、テキストが出力、動画はどちらの方向にもなし——一方で、それを有名にしたデモは動画だ。この二つの事実は矛盾しておらず、それを矛盾として読むことが、コード動画の話を混乱させる。モデルがレンダラーを書き、レンダラーが映像を作る。モデルに渡せるのは、スクリプトと文書とスクリーンショットだ。

The OrcaRouter model page for Claude Opus 5.5, showing the Context, modalities and thinking section with text, image and file input, text output, a 1M-token context window and up to 128K output tokens.

上記のすべては、2026年9月29日時点のOrcaRouterカタログのスナップショットと、そこに記載されたモダリティ宣言です。ベンダーの仕様は変わるもので、数値を前提に何かを構築する前に最初に再確認すべきなのは、モデルカードのモダリティ一覧です。ここに記載されている主張が意思決定に関わる場合は、モデルページを開いてください。項目はそこにあります。