Kartu hero multimodal Claude Opus 5.5: nama model di atas kartu judul yang dihasilkan.
Guides & Insights

Claude Opus 5.5 Multimodal: Ia Merender Video dari Kode, tetapi Tidak Bisa Menontonnya

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Minta Claude Opus 5.5 untuk sebuah video dan Anda bisa mendapatkan satu — program HTML, CSS, atau panggilan canvas yang melukis setiap frame, yang kemudian Anda jalankan. Berikan sebuah video dan tanyakan apa yang terjadi di dalamnya dan Anda tidak mendapatkan apa-apa sama sekali, karena tidak ada input video. Asimetri itulah keseluruhan permukaan modalitas model ini, dan hal itu identik pada kesebelas model Anthropic di papan kami, jadi layak dinyatakan secara gamblang: Claude Opus 5.5 membaca teks, gambar, dan file, menulis teks, dan berhenti di situ. Papan di sekitarnya jauh lebih tidak seragam. MiniMax H3 menghasilkan video secara langsung, OrcaDub 1.0 menerima video dan mengembalikan video yang disulih suara, dan Qwen3.8-Max akan menonton klip dengan harga dua dolar per juta token input — setengah dari yang Claude Opus 5.5 kenakan untuk juta yang sama, dan dengan kemampuan yang tidak dimilikinya.

Ini adalah pembacaan atas baris modalitas sebagaimana dicatat oleh OrcaRouter pada 2026-09-29, mencakup semua 204 model dalam katalog. Angka-angka di bawah ini adalah deklarasi katalog, bukan tolok ukur kami — bidang modalitas adalah apa yang tertulis di kartu model, dan kartu model dapat berubah.

Apa yang sebenarnya dicatat oleh katalog

Dari 204 model, 182 mendeklarasikan permukaan input. 22 sisanya membiarkannya kosong, yang merupakan pernyataan tentang catatan tersebut, bukan tentang modelnya — delapan model video Kling, empat meta-model OrcaRouter, dan beberapa endpoint tingkat gratis serta pratinjau di antaranya.

A horizontal bar chart of declared input modalities across the OrcaRouter catalogue: 131 models read images, 77 read files, 49 read video, 19 read audio, and 50 take text only.

Di seluruh 182 itu:

• 131 gambar dibaca

• 77 file yang bisa dibaca — dan setiap dari 77 itu juga membaca gambar, jadi input file merupakan penguatan bagi input gambar di board ini, bukan modalitas keenam yang terpisah

• 49 video ditonton

• 19 dengar audio

• 50 ambil teks dan tidak ada yang lain

Claude Opus 5.5 berada pada jalur gambar-dan-file dan bukan pada jalur video. Halaman model kami sendiri menyatakannya dalam satu kalimat, di bawah judul "Konteks, modalitas, dan pemikiran": input multimodal — teks, gambar, dan file — dengan output teks, jendela konteks 1 juta token, dan hingga 128 ribu token output. Itulah keseluruhan cakupan input. Tidak ada entri kelima yang tersembunyi di dalam submenu.

Lima puluh adalah angka yang lebih besar daripada yang diperkirakan kebanyakan orang. Lebih dari seperempat model yang menyatakan apa pun sama sekali hanya menerima teks, yang berarti pipeline yang dibangun dengan asumsi bahwa ia dapat melampirkan tangkapan layar dan membuatnya dipahami akan rusak pada seperempat papan ini.

Mengapa "video dengan kode" bukan modalitas video

Demo yang beredar itu nyata, dan begitu pula efeknya: Claude Opus 5.5 luar biasa mahir menulis program yang menggambar gerakan — perender mandiri yang menghasilkan frame saat Anda menjalankannya. Itu adalah kemampuan yang nyata dan berguna. Yang bukan merupakan modalitas keluaran adalah hal itu. Katalog mencatat tepat satu keluaran untuk model ini, dan itu adalah teks. Video itu diproduksi di sisi hilir, oleh kode yang ditulis oleh model, di mesin Anda, dengan perender Anda.

Konsekuensi praktisnya berlaku dua arah, dan bagian kedua itulah bagian yang sering orang lewatkan.

Di tahap keluaran, Anda yang memegang kendali atas langkah render. Video berbasis kode dapat diperiksa, di-diff, dijalankan ulang pada resolusi berbeda, dan murah dengan cara yang sama seperti respons teks itu murah — beberapa dolar token, bukan meteran penagihan per detik. Anda juga memikul setiap kegagalan: font yang hilang, anggaran frame yang buruk, renderer yang tidak sesuai dengan kode yang diberikan kepadanya.

Saat masuk, tidak ada apa pun yang bisa diberikan kepadanya. Jika materi sumber Anda adalah rekaman layar, klip produk, webinar dua jam, atau film peluncuran kompetitor, Claude Opus 5.5 tidak dapat melihatnya. Anda hanya bisa mengirimkan transkrip, slide sebagai bingkai diam, atau deskripsi yang ditulis orang lain. Itulah kendala yang sebenarnya menentukan arsitektur, dan tidak terlihat dalam demo reel.

Dua kubu: 60 model menerima dokumen, 29 menerima klip

Kelompokkan 182 model berdasarkan himpunan input persisnya dan papan tersebut terbagi menjadi dua kelompok yang nyaris tidak tumpang tindih.

Kamp A — dokumen dan gambar, tanpa video: 60 model. Harga input median $2,00 per juta token. Di sinilah Claude Opus 5.5 berada, bersama sebelas model Anthropic, tiga dari lima baris Grok, dan ujung penalaran katalog OpenAI — setiap baris GPT-4.1 dan GPT-6, serta dalam keluarga GPT-4o dan GPT-5 semuanya kecuali varian voice, codex, search, dan chat-latest. Kamp A juga memegang plafon tabel harga: openai/gpt-5.5-pro dan openai/gpt-5.4-pro pada $30 per juta token input. Itulah harga input tertinggi di seluruh papan, dan itu adalah harga yang mereka bagi dengan dua baris GPT-4 OpenAI dan dua endpoint text-to-speech, yang tak satu pun membaca dokumen. Tak satu pun dari delapan itu dapat menonton video.

Kamp B — teks, gambar, dan video, tanpa file: 29 model. Harga input median $0.25 per juta token. Dua puluh dua dari dua puluh sembilan menyandang prefiks Qwen; sisanya adalah MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B, dan dua build Qwen yang disetel Obsidian. Batas atasnya adalah Qwen3.8-Max pada $2.00 per juta — yang berarti model pembaca video termahal di kamp ini harganya tepat setengah dari Claude Opus 5.5.

Selisih median antara kedua kubu adalah 8×. Kesenjangan keanggotaannya bahkan lebih mencolok. Dari 182 model yang mendeklarasikan permukaan masukan, 60 menerima dokumen dan bukan video, 32 menerima video dan bukan dokumen, 73 tidak menerima keduanya, dan hanya 17 menerima keduanya. Tumpang tindihnya cukup kecil sehingga kedua kelompok itu terbaca sebagai produk yang nyaris terpisah sepenuhnya, dan 17 model di tengah hampir seluruhnya merupakan tier atas Google — lima belas dari tujuh belas — ditambah dua build Muse Spark dari Meta.

A comparison scoreboard contrasting the two catalogue camps: 60 document-and-image models at a median $2.00 per million input tokens against 29 video-and-image models at a median $0.25 per million.

Ada alasan yang masuk akal untuk bentuk tersebut. Pemahaman dokumen dan pemahaman video adalah masalah rekayasa yang berbeda dengan kurva biaya yang berbeda, dan vendor yang lebih dulu menyelesaikan video, sebagian besar, adalah pihak yang menjual token murah dalam jumlah ratusan juta. Vendor yang lebih dulu menyelesaikan dokumen adalah pihak yang menjual penalaran dengan harga premium. Belum ada yang dipaksa untuk melakukan keduanya dengan harga yang sama, sehingga pasar terbelah menjadi dua produk dan menetapkan harganya sesuai dengan itu.

Sembilan belas yang mengambil segalanya

Sembilan belas model menerima keempat jenis input — teks, gambar, video, dan audio. Enam belas di antaranya Google, dua Meta, satu MiniMax. Rentang milik Google sendiri di dalam kubu itu membentang dari $0,10 per juta untuk gemini-2.5-flash-lite hingga $4,00 untuk gemini-pro-latest, jadi "membaca segalanya" bukanlah tingkatan harga; itu adalah keputusan yang dibuat Google di setiap titik harga. Kontribusi Meta adalah sepasang build Muse Spark — Muse Spark 1.1 dan Muse Spark 1.2, yang identik dalam katalog pada $1,25 per juta untuk input dan $4,25 untuk output, dengan konteks 1M token.

Inilah kubu yang menyampaikan inti argumen artikel: pipeline yang sadar video tidak memerlukan model unggulan. Yang diperlukan adalah memilih dari daftar sembilan belas, sepuluh di antaranya berbiaya kurang dari satu dolar per juta token masukan.

Lima model di papan ini mengeluarkan sesuatu selain teks

Membaca video dan membuatnya adalah trik yang berbeda, dan yang kedua lebih langka. Dari 204 model, 139 mendeklarasikan permukaan keluaran; lima di antaranya menyebut sesuatu selain teks.

Tiga di antaranya adalah generator gambar: Nano Banana (Gemini 2.5 Flash Image) dengan biaya $0,30 untuk input dan $30,00 untuk output per juta token, Nano Banana Pro (Gemini 3 Pro Image Preview) seharga $0,24 per permintaan, dan Nano Banana 2 (Gemini 3.1 Flash Image Preview) seharga $0,151 per permintaan. Dua menghasilkan video: MiniMax H3, ditagih per detik output yang dihasilkan — $0,08 per detik pada 768P dan $0,13 pada 2K, untuk klip berdurasi empat hingga lima belas detik dengan audio stereo native — dan OrcaDub 1.0, ditagih $0,60 per menit video sumber, mencakup 28 bahasa dan mengkloning suara terpisah per pembicara.

Ada dua pembingkaian yang perlu dihindari di sini. Pertama, 65 baris yang tersisa membiarkan kolom output kosong; kosong berarti katalog tidak mencatat adanya permukaan output, dan itu bukan bukti bahwa sebuah model hanya menghasilkan teks. Kedua, membaca video dan membuat video adalah sumbu yang terpisah dengan hampir tidak ada tumpang tindih di papan ini — OrcaDub 1.0 menerima video sebagai input dan mengembalikan video, yang menjadikannya satu-satunya model di sini yang secara masuk akal berada di kedua ujung pipeline, sementara MiniMax H3 menerima empat jenis input untuk menghasilkan satu jenis output yang bukan teks.

Apa yang harus dirutekan ke mana

Empat aturan muncul dari sensus itu, dan aturan-aturan itu murah untuk diterapkan.

• Jika masukan Anda berupa klip, jangan langsung memilih model unggulan terdepan. Kubu yang membaca video tanpa memerlukan dokumen terdiri dari 29 model, dua puluh dua di antaranya Qwen, dan mediannya adalah seperempat dolar per juta token. Sebaliknya, kirimkan frame dan transkrip kepada model unggulan itu, lalu biarkan ia melakukan penalaran.

• Jika input Anda berupa PDF, kontrak, atau dokumen panjang, kubu video adalah kubu yang keliru. Hanya 17 model yang mendeklarasikan input file sekaligus video, dan setiap model yang mendeklarasikan input file juga mendeklarasikan input gambar, jadi keduanya selalu berjalan berdampingan. Claude Opus 5.5 dengan $4,00 per juta membeli cakupan dokumen plus jendela 1 juta token, itulah pertukaran yang Anda lakukan.

• Jika Anda memerlukan keluaran media, Anda memilih dari lima model, bukan dari papan. Tiga menghasilkan gambar statis dan dua menghasilkan video, dan keduanya menagih per detik dan per menit, bukan per token — jadi perkiraan biaya yang dibuat dari harga input pasti salah sejak awal.

• Jika Anda memerlukan keluaran video dan sumber Anda adalah skrip, pembuatan kode tetap menjadi rute termurah di papan ini. Claude Opus 5.5 menulis perender dengan harga teks; MiniMax H3 merendernya seharga delapan sen per detik. Merangkai keduanya lebih murah daripada alternatif mana pun dan menghasilkan berkas yang dapat Anda edit.

FAQ

Bisakah Claude Opus 5.5 menonton video?

Tidak. Modalitas masukan yang dideklarasikan adalah teks, gambar, dan file. Video tidak termasuk di antaranya, dan audio juga tidak. Rekaman layar atau klip produk harus dikonversi — frame yang diambil sampelnya, transkrip, atau keduanya — sebelum dapat dikirim.

Apakah Claude Opus 5.5 menghasilkan video secara langsung?

Bukan sebagai modalitas. Ia mengembalikan teks, dan teks itu sering kali merupakan program mandiri yang merender gerakan saat Anda menjalankannya. Perenderan dilakukan di sisi Anda; model tidak pernah mengeluarkan satu piksel pun. Jika Anda menginginkan model di papan ini yang mengembalikan video itu sendiri, MiniMax H3 dan OrcaDub 1.0 adalah dua di antaranya.

Apakah "multimodal" termasuk tingkatan harga?

Tidak, dan papan peringkat menunjukkan alasannya di kedua arah. Google menyediakan multimodalitas empat input penuh dari $0,10 per juta token input hingga $4,00, sementara harga input tertinggi bersama di papan peringkat — openai/gpt-5.5-pro pada $30 per juta — membaca dokumen dan gambar tetapi tidak video. Yang Anda bayar adalah tier penalaran, bukan jumlah modalitas.

Mengapa begitu sedikit model yang membaca dokumen jika begitu banyak yang membaca gambar?

Karena file dan gambar hadir bersama di papan ini: semua 77 model pembaca file juga membaca gambar, jadi input file merupakan perpanjangan dari input gambar, bukan kemampuan independen. Angka yang perlu diingat adalah bahwa 60 dari 182 model yang mendeklarasikan permukaan input menerima dokumen dan gambar dan sama sekali tidak menerima video — sepertiga dari papan, dan di situlah tier unggulan berada.

Bagaimana saya harus menetapkan harga untuk pipeline video?

Berdasarkan satuan yang digunakan model untuk menagih. Pembaca video dikenakan tarif per token, seperti model chat mana pun. Generator video di papan ini dikenakan tarif per detik keluaran (MiniMax H3: $0.08 pada 768P, $0.13 pada 2K) atau per menit sumber (OrcaDub 1.0: $0.60). Mencampur kedua satuan ke dalam satu perkiraan adalah cara paling umum anggaran video menjadi salah.

Baris yang perlu diingat

Hal yang menarik tentang Claude Opus 5.5 bukanlah bahwa ia bersifat multimodal. Sebagian besar papan peringkat juga begitu. Yang menarik adalah bahwa garis modalitasnya jatuh di tempat yang tidak biasa — dokumen dan gambar diam masuk, teks keluar, tanpa video di kedua arah — sementara demo yang membuatnya terkenal justru berupa video. Kedua fakta itu tidak saling bertentangan, dan menafsirkannya sebagai pertentangan itulah yang membuat kisah video-kode membingungkan. Model menulis perender; perender itulah yang membuat filmnya. Yang dapat diberikan kepada model adalah naskah, dokumen, dan tangkapan layar.

The OrcaRouter model page for Claude Opus 5.5, showing the Context, modalities and thinking section with text, image and file input, text output, a 1M-token context window and up to 128K output tokens.

Semua yang di atas adalah cuplikan katalog OrcaRouter pada 2026-09-29 dan deklarasi modalitas di dalamnya. Spesifikasi vendor berubah, dan daftar modalitas pada kartu model adalah hal pertama yang perlu diperiksa ulang sebelum Anda mengandalkan suatu angka. Jika ada klaim di sini yang penting untuk suatu keputusan, buka halaman model — field-nya ada di sana.