
Claude Opus 5.5 멀티모달: 코드로 영상을 렌더링하지만, 영상을 볼 수는 없다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 1009 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 195 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
동영상을 요청하면Claude Opus 5.5 실제로 동영상을 얻게 될 수도 있다 — 모든 프레임을 그려내는 HTML, CSS 또는 캔버스 호출로 이루어진 프로그램, 즉 여러분이 직접 실행하는 프로그램이다. 동영상을 건네주고 그 안에서 무슨 일이 일어나는지 물어봐도 아무것도 얻지 못한다. 동영상 입력이 없기 때문이다. 이 비대칭성이 바로 이 모델의 모달리티 표면 전부이며, 우리 보드에 있는 열한 개의 Anthropic 모델 모두에서 동일하므로, 분명히 짚고 넘어갈 가치가 있다: Claude Opus 5.5는 텍스트, 이미지, 파일을 읽고 텍스트를 쓰며, 거기서 멈춘다. 그 주변의 보드는 훨씬 덜 균일하다. MiniMax H3는 동영상을 곧바로 생성하고, OrcaDub 1.0은 동영상을 입력받아 더빙된 동영상을 돌려주며, Qwen3.8-Max는 입력 토큰 백만 개당 2달러에 클립을 시청한다 — 그 절반인 Claude Opus 5.5가 같은 백만 개에 부과하는 금액이며, 게다가 그것이 갖지 못한 능력까지 갖추고 있다.
이것은 OrcaRouter가 2026-09-29에 기록한 모달리티 라인을 카탈로그의 전체 204개 모델에 걸쳐 읽은 것입니다. 아래 숫자는 카탈로그 선언이며, 우리의 벤치마크가 아닙니다 — 모달리티 필드는 모델 카드가 말하는 것이고, 모델 카드는 바뀝니다.
카탈로그가 실제로 기록하는 것
204개 모델 중 182개가 입력 표면을 선언합니다. 나머지 22개는 이를 비워 두는데, 이는 모델이 아니라 기록에 관한 진술입니다. 그중에는 8개의 Kling 비디오 모델, 4개의 OrcaRouter 메타 모델, 그리고 여기저기 흩어져 있는 무료 티어 및 프리뷰 엔드포인트가 포함됩니다.

그 182개 전반에 걸쳐:
• 이미지 131개 읽음
• 파일 읽기 77개 — 그리고 그 77개 모두 이미지도 읽으므로, 이 보드에서 파일 입력은 이미지 입력의 강화일 뿐, 결코 별개의 여섯 번째 모달리티가 아닙니다
• 읽은 동영상 49개
•19단어
• 50 텍스트만 가져오고 다른 것은 아무것도 하지 마세요
Claude Opus 5.5는 이미지 및 파일 계열에 속하며 비디오 계열에는 속하지 않습니다. 우리 자체 모델 페이지에서도 "컨텍스트, 모달리티 및 사고"라는 제목 아래 한 문장으로 이를 말합니다: 멀티모달 입력 — 텍스트, 이미지 및 파일 — 과 텍스트 출력, 1M 토큰 컨텍스트 창, 최대 128K 출력 토큰입니다. 이것이 입력 표면의 전부입니다. 하위 메뉴에 숨어 있는 다섯 번째 항목은 없습니다.
50은 대부분의 사람들이 예상하는 것보다 큰 숫자입니다. 뭔가를 명시하는 모델 가운데 4분의 1 이상이 텍스트만 받습니다. 즉, 스크린샷을 첨부하면 알아서 이해해 줄 것이라는 가정 위에 세운 파이프라인은 이 보드의 4분의 1에서 깨지게 됩니다.
"코드가 있는 비디오"는 왜 비디오 모달리티가 아닌가
화제가 된 데모들은 진짜이고, 그 효과도 진짜다: Claude Opus 5.5는 움직임을 그리는 프로그램 — 실행하면 프레임을 만들어 내는 자체 포함형 렌더러 — 를 작성하는 데 유난히 뛰어나다. 그것은 실제 역량이며 유용한 역량이다. 그것이 아닌 것은 출력 모달리티다. 카탈로그에는 이 모델에 대해 정확히 하나의 출력이 기록되어 있으며, 그것은 텍스트. 비디오는 다운스트림에서, 모델이 작성한 코드에 의해, 당신의 머신에서, 당신의 렌더러로 만들어진다.
실질적인 결과는 양쪽 모두에 적용되는데, 사람들이 놓치는 것은 바로 그 두 번째 측면이다.
출력 단계에서 렌더 단계는 당신 책임이다. 코드 기반 비디오는 검사할 수 있고, 차이를 비교할 수 있으며, 다른 해상도로 다시 실행할 수 있고, 텍스트 응답이 저렴한 방식으로 저렴하다 — 초당 과금 미터기가 아니라 몇 달러어치 토큰이다. 모든 실패도 당신 책임이다: 빠진 폰트, 잘못된 프레임 예산, 넘겨받은 코드와 어긋나는 렌더러.
입력 단계에서는 그것에 건넬 수 있는 것이 아무것도 없다. 원본 소재가 화면 녹화본이든, 제품 클립이든, 두 시간짜리 웨비나든, 경쟁사의 출시 영상이든, Claude Opus 5.5는 그것을 볼 수 없다. 당신이 보낼 수 있는 것은 녹취록, 정지 이미지로 변환한 슬라이드, 또는 다른 누군가가 쓴 설명뿐이다. 바로 이것이 아키텍처를 실제로 결정하는 제약이며, 데모 영상에서는 눈에 띄지 않는다.
두 진영: 모델 60개는 문서를, 29개는 클립을 택한다
182개 모델을 정확한 입력 세트별로 묶으면, 보드는 거의 겹치지 않는 두 그룹으로 나뉜다.
캠프 A — 문서와 이미지, 비디오 없음: 60개 모델. 중앙값 입력 가격 백만 토큰당 $2.00. 여기에 Claude Opus 5.5가 있습니다. Anthropic 모델 11개 전부, Grok 5개 행 중 3개, 그리고 OpenAI 카탈로그의 추론 쪽 — 모든 GPT-4.1 및 GPT-6 행, 그리고 GPT-4o와 GPT-5 계열에서는 voice, codex, search, chat-latest 변형을 제외한 모든 것이 함께 있습니다. 캠프 A는 가격표의 최고점도 차지합니다: openai/gpt-5.5-pro와 openai/gpt-5.4-pro가 백만 입력 토큰당 $30입니다. 이는 보드 전체에서 가장 높은 입력 가격이며, 문서를 읽지 않는 두 개의 OpenAI GPT-4 행과 두 개의 텍스트 음성 변환 엔드포인트가 공유하는 가격입니다. 이 여덟 개 중 어느 것도 비디오를 볼 수 없습니다.
캠프 B — 텍스트, 이미지, 비디오, 파일 없음: 모델 29개. 입력 가격 중앙값 백만 토큰당 $0.25. 29개 중 22개는 Qwen 접두사를 달고 있으며, 나머지는 MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B, 그리고 Obsidian용으로 튜닝된 Qwen 빌드 두 개다. 이 캠프의 최고가는 Qwen3.8-Max로 백만 토큰당 $2.00 — 즉 이 캠프에서 가장 비싼 비디오 판독 모델의 가격은 Claude Opus 5.5의 정확히 절반이다.
두 진영 사이의 중앙값 격차는 8×. 소속 격차는 훨씬 더 뚜렷하다. 입력 표면을 밝힌 182개 모델 중 60개는 문서를 받고 비디오는 받지 않으며, 32개는 비디오를 받고 문서는 받지 않고, 73개는 둘 다 받지 않으며, 오직 17개만 둘 다 받는다. 겹치는 부분이 작아서 두 그룹은 거의 서로 겹치지 않는 제품으로 보이며, 중간에 있는 17개는 거의 전부 Google의 상위 계층 — 17개 중 15개 — 이며, 여기에 Meta의 Muse Spark 빌드 두 개가 더해진다.

그런 형태에는 그럴 만한 이유가 있다. 문서 이해와 비디오 이해는 서로 다른 비용 곡선을 지닌 서로 다른 엔지니어링 문제이며, 비디오를 먼저 해결한 업체들은 대부분 값싼 토큰을 1억 개 단위로 파는 곳들이다. 문서를 먼저 해결한 업체들은 추론을 프리미엄 가격에 파는 곳들이다. 아직 누구도 두 가지를 같은 가격에 모두 해내야 하는 상황에 내몰리지 않았기 때문에, 시장은 두 제품으로 갈라졌고 그에 맞게 가격을 매겼다.
모든 것을 가져가는 열아홉
19개 모델이 텍스트, 이미지, 비디오, 오디오의 네 가지 입력 유형을 모두 받습니다. 그중 16개는 Google, 2개는 Meta, 1개는 MiniMax입니다. 이 범주에서 Google 자체의 폭은 백만 토큰당 $0.10인 gemini-2.5-flash-lite부터 $4.00인 gemini-pro-latest까지 이어지므로, "모든 것을 읽는다"는 것은 가격 등급이 아닙니다. 그것은 Google이 모든 가격대에서 내린 결정입니다. Meta가 내놓은 것은 Muse Spark 두 빌드 — Muse Spark 1.1과 Muse Spark 1.2로, 카탈로그상 백만 토큰당 입력 $1.25, 출력 $4.25로 동일하며 100만 토큰 컨텍스트를 갖습니다.
이것이 이 글의 실질적 요점을 만들어 내는 진영이다: 비디오 인식 파이프라인에는 플래그십 모델이 필요하지 않다. 필요한 것은 19개 목록에서 고르는 것뿐이며, 그중 10개는 백만 입력 토큰당 1달러 미만이다.
이 보드의 다섯 모델은 텍스트가 아닌 무언가를 출력합니다.
동영상을 읽는 것과 만드는 것은 서로 다른 기술이며, 두 번째가 더 드물다. 204개 모델 중 139개가 출력 표면을 선언한다; 그중 다섯 개는 텍스트가 아닌 다른 것을 지칭한다.
세 가지는 이미지 생성기입니다: Nano Banana (Gemini 2.5 Flash Image)의 경우 백만 토큰당 입력 $0.30, 출력 $30.00, Nano Banana Pro (Gemini 3 Pro Image Preview)의 경우 요청당 $0.24, 그리고 Nano Banana 2 (Gemini 3.1 Flash Image Preview)의 경우 요청당 $0.151입니다. 두 가지는 동영상을 생성합니다: MiniMax H3, 생성된 출력 1초당 과금 — 768P에서 초당 $0.08, 2K에서 $0.13, 네이티브 스테레오 오디오가 포함된 4초에서 15초 길이의 클립 — 그리고 OrcaDub 1.0, 원본 동영상 1분당 $0.60 과금, 28개 언어 지원 및 화자별 별도 음성 복제.
여기서 피해야 할 두 가지 해석 방식이 있다. 첫째, 나머지 65개 행은 출력 필드를 비워 둔다. 비어 있다는 것은 카탈로그가 출력 표면을 기록하지 않았다는 뜻이며, 모델이 텍스트만 출력한다는 증거는 아니다. 둘째, 영상을 읽는 것과 영상을 만드는 것은 이 보드에서 거의 겹치지 않는 별개의 축이다 — OrcaDub 1.0의 경우 영상을 입력받아 영상을 돌려주므로, 여기서 파이프라인의 양 끝에 모두 타당하게 위치할 수 있는 유일한 모델이다. 반면 MiniMax H3의 경우 네 가지 입력 유형을 받아 텍스트가 아닌 단일 출력 유형을 생성한다.
무엇을 어디로 라우팅할지
이 조사에서 네 가지 규칙이 도출되는데, 적용하는 데는 비용이 거의 들지 않는다.
• 입력이 클립이라면, 먼저 프런티어 플래그십을 선택하지 마세요. 문서 없이 비디오를 읽는 진영은 29개 모델이고, 그중 22개가 Qwen이며, 중앙값은 백만당 25센트입니다. 대신 플래그십에 프레임과 스크립트를 보내고, 추론은 플래그십이 하도록 하세요.
• 입력이 PDF, 계약서 또는 긴 문서라면 비디오 진영은 잘못된 진영입니다. 파일과 비디오 입력을 모두 선언한 모델은 17개뿐이며, 파일 입력을 선언한 모든 모델은 이미지 입력도 선언하므로 이 둘은 함께 갑니다. Claude Opus 5.5 는 백만 개당 $4.00에 문서 표면과 1M 토큰 창을 함께 제공하는데, 이것이 바로 여러분이 하고 있는 거래입니다.
• 미디어 출력이 필요하다면, 보드가 아니라 다섯 개 모델 중에서 선택하게 됩니다. 세 개는 정지 이미지를 만들고 두 개는 영상을 만들며, 그 두 개는 토큰당이 아니라 초당 및 분당으로 과금됩니다 — 따라서 입력 가격으로 산출한 비용 추정치는 구조적으로 틀릴 수밖에 없습니다.
• 영상 출력이 필요하고 소스가 스크립트라면, 이 보드에서 코드 생성이 여전히 가장 저렴한 경로입니다. Claude Opus 5.5는 텍스트 가격으로 렌더러를 작성하고, MiniMax H3는 초당 8센트로 렌더링합니다. 두 가지를 연계하면 어느 한쪽보다 비용이 적게 들고 편집할 수 있는 파일을 남겨 줍니다.
자주 묻는 질문
Claude Opus 5.5는 동영상을 볼 수 있나요?
아니요. 선언된 입력 양식은 텍스트, 이미지, 파일입니다. 동영상은 그중에 없고, 오디오도 마찬가지입니다. 화면 녹화나 제품 클립은 보내기 전에 변환해야 합니다 — 샘플링된 프레임, 전사본, 또는 둘 다로.
Claude Opus 5.5는 동영상을 직접 생성하나요?
모달리티로서가 아닙니다. 텍스트를 반환하며, 그 텍스트는 흔히 실행하면 모션을 렌더링하는 자체 완결형 프로그램입니다. 렌더링은 여러분 몫입니다; 모델은 픽셀을 전혀 출력하지 않습니다. 이 보드에서 비디오 자체를 반환하는 모델을 원한다면, MiniMax H3와 OrcaDub 1.0이 두 가지입니다.
"multimodal"은 가격 등급인가요?
아니요, 그리고 그 이유는 표에서 양방향으로 드러납니다. Google은 100만 입력 토큰당 $0.10에서 $4.00까지 완전한 4개 입력 멀티모달리티를 제공하는 반면, 표에서 공동 최고 입력 가격인 openai/gpt-5.5-pro는 100만 토큰당 $30으로 문서와 이미지는 읽지만 영상은 읽지 못합니다. 여러분이 지불하는 것은 모달리티 개수가 아니라 추론 등급입니다.
그렇게 많은 모델이 이미지를 읽는데 왜 그렇게 적은 모델만 문서를 읽나요?
이 보드에서는 파일과 이미지가 함께 다뤄지기 때문입니다: 파일을 읽는 77개 모델 모두 이미지도 읽으므로, 파일 입력은 독립적인 기능이라기보다 이미지 입력의 확장입니다. 기억해야 할 숫자는 입력 표면을 선언한 182개 모델 중 60개가 문서와 이미지를 받고 동영상은 전혀 받지 않는다는 점입니다 — 이는 보드의 3분의 1이며, 플래그십 등급이 자리한 곳이기도 합니다.
비디오 파이프라인 가격은 어떻게 책정해야 하나요?
모델이 청구하는 단위에 따라 다릅니다. 비디오 리더는 여느 채팅 모델과 마찬가지로 토큰당 가격이 책정됩니다. 이 보드의 비디오 생성기는 출력 초당 가격(MiniMax H3: 768P에서 $0.08, 2K에서 $0.13) 또는 소스 분당 가격(OrcaDub 1.0: $0.60)으로 책정됩니다. 이 두 단위를 하나의 추정치에 섞는 것이 비디오 예산이 잘못 산출되는 가장 흔한 이유입니다.
기억해야 할 한 줄
에 대해 흥미로운 점은 Claude Opus 5.5그것이 멀티모달이라는 점이 아닙니다. 보드 대부분이 그렇습니다. 흥미로운 점은 모달리티 경계가 이례적인 위치에 놓여 있다는 것입니다 — 문서와 정지 이미지는 입력, 텍스트는 출력, 비디오는 어느 방향으로도 없음 — 반면 그것을 유명하게 만든 데모는 비디오입니다. 이 두 사실은 충돌하지 않으며, 이를 충돌로 읽는 것이 바로 코드-비디오 이야기를 혼란스럽게 만듭니다. 모델은 렌더러를 작성하고, 렌더러가 영상을 만듭니다. 모델이 건네받을 수 있는 것은 대본, 문서, 스크린샷입니다.

위의 모든 내용은 2026-09-29 기준 OrcaRouter 카탈로그의 스냅샷과 그 안의 모달리티 선언입니다. 벤더 사양은 바뀌며, 모델 카드의 모달리티 목록은 숫자에 의존해 무언가를 구축하기 전에 가장 먼저 다시 확인해야 할 항목입니다. 여기 있는 어떤 주장이 결정에 중요하다면 모델 페이지를 열어 보세요 — 해당 필드들이 거기에 있습니다.
