
Claude Opus 5.5 Đa phương thức: Nó kết xuất video từ mã, nhưng lại không thể xem nổi một video
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 1009 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 195 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Yêu cầu Claude Opus 5.5 làm một video và bạn có thể nhận được một video — một chương trình gồm các lệnh gọi HTML, CSS hoặc canvas vẽ từng khung hình, rồi bạn chạy nó. Đưa nó một video và hỏi điều gì xảy ra trong đó thì bạn chẳng nhận được gì cả, vì không có đầu vào video. Sự bất đối xứng đó chính là toàn bộ bề mặt phương thức của mô hình này, và nó giống hệt ở cả mười một mô hình Anthropic trên bảng của chúng tôi, nên đáng nói thẳng: Claude Opus 5.5 đọc văn bản, hình ảnh và tệp, viết văn bản, và chỉ có thế. Bảng xếp hạng xung quanh nó thì kém đồng nhất hơn nhiều. MiniMax H3 tạo video trực tiếp, OrcaDub 1.0 nhận video đầu vào và trả về một video đã lồng tiếng, còn Qwen3.8-Max sẽ xem một clip với giá hai đô la cho mỗi triệu token đầu vào — bằng một nửa mức Claude Opus 5.5 tính cho cùng một triệu, và với một năng lực mà nó không có.
Đây là bản đọc dòng modality theo cách OrcaRouter ghi nhận vào ngày 2026-09-29, trên toàn bộ 204 mô hình trong danh mục. Các con số dưới đây là khai báo trong danh mục, không phải kết quả benchmark của chúng tôi — trường modality là những gì model card nêu, mà model card thì thay đổi.
Những gì danh mục thực sự ghi lại
Trong số 204 mô hình, 182 mô hình khai báo một bề mặt đầu vào. 22 mô hình còn lại để trống, điều này nói lên về bản ghi chứ không phải về mô hình — trong đó có tám mô hình video Kling, bốn meta-model OrcaRouter, cùng một số endpoint miễn phí và bản xem trước rải rác.

Trong số 182 đó:
• 131 ảnh đã đọc
• 77 đọc tệp — và cả 77 mô hình đó đều cũng đọc được hình ảnh, nên đầu vào tệp là sự củng cố cho đầu vào hình ảnh trên bảng này, chứ không bao giờ là một phương thức thứ sáu riêng biệt
• 49 video đã đọc
• 19 nghe âm thanh
• 50 lấy văn bản và không gì khác
Claude Opus 5.5thuộc tuyến hình ảnh và tệp tin, không thuộc tuyến video. Trang mô hình của chính chúng tôi nói rõ điều đó trong một câu, dưới tiêu đề "Ngữ cảnh, phương thức và tư duy": đầu vào đa phương thức — văn bản, hình ảnh và tệp tin — với đầu ra văn bản, cửa sổ ngữ cảnh 1M token và tối đa 128K token đầu ra. Đó là toàn bộ bề mặt đầu vào. Không có mục thứ năm nào ẩn trong menu con.
Năm mươi là một con số lớn hơn mức hầu hết mọi người tưởng. Hơn một phần tư số mô hình có khai báo bất cứ điều gì chỉ nhận văn bản, nghĩa là một pipeline được xây dựng trên giả định rằng nó có thể đính kèm ảnh chụp màn hình và ảnh đó được hiểu sẽ hỏng với một phần tư bảng này.
Tại sao "video with code" không phải là một phương thức video
Các bản demo được lan truyền rộng rãi là thật, và hiệu ứng cũng vậy: Claude Opus 5.5 đặc biệt giỏi viết chương trình tạo chuyển động — một trình kết xuất khép kín tạo ra các khung hình khi bạn chạy nó. Đó là một năng lực có thật và hữu ích. Điều nó không phải là một phương thức đầu ra. Danh mục chỉ ghi nhận đúng một đầu ra cho mô hình này, và đó là văn bản. Video được tạo ra ở hạ nguồn, bằng mã mà mô hình đã viết, trên máy của bạn, bằng trình kết xuất của bạn.
Hệ quả thực tiễn có tác động theo cả hai hướng, và nửa sau chính là nửa mà người ta bỏ qua.
Ở khâu đầu ra, bạn là người chịu trách nhiệm cho bước render. Video dựa trên code có thể kiểm tra, có thể so sánh khác biệt, có thể chạy lại ở độ phân giải khác và rẻ theo cách một phản hồi văn bản là rẻ — vài đô la token thay vì đồng hồ tính phí theo giây. Bạn cũng phải chịu trách nhiệm cho mọi lỗi hỏng: thiếu font, ngân sách khung hình kém, một renderer không khớp với đoạn mã mà nó được giao.
Ở đầu vào, không có gì để đưa cho nó. Nếu tư liệu nguồn của bạn là bản ghi màn hình, một clip sản phẩm, một webinar dài hai tiếng, hay phim ra mắt của đối thủ, thì Claude Opus 5.5 không thể nhìn vào nó. Bạn chỉ có thể gửi bản chép lời, các slide dưới dạng ảnh tĩnh, hoặc mô tả do người khác viết. Đó là ràng buộc thực sự quyết định kiến trúc, và nó vô hình trong một demo reel.
Hai phe: 60 mô hình nhận tài liệu, 29 nhận clip
Nhóm 182 mô hình theo tập đầu vào chính xác của chúng và bảng tách thành hai nhóm hầu như không chồng lấn.
Nhóm A — tài liệu và hình ảnh, không có video: 60 mô hình.Giá đầu vào trung vị 2,00 USD mỗi triệu token. Đây là vị trí của Claude Opus 5.5, cùng với toàn bộ mười một mô hình Anthropic, ba trong số năm dòng Grok, và phần suy luận của danh mục OpenAI — mọi dòng GPT-4.1 và GPT-6, và trong các họ GPT-4o và GPT-5 là mọi thứ trừ các biến thể voice, codex, search và chat-latest. Nhóm A cũng giữ mức trần của bảng giá: openai/gpt-5.5-pro và openai/gpt-5.4-pro ở mức 30 USD mỗi triệu token đầu vào. Đó là mức giá đầu vào cao nhất trên toàn bộ bảng, và đó là mức giá mà chúng chia sẻ với hai dòng GPT-4 của OpenAI và hai endpoint chuyển văn bản thành giọng nói, không cái nào trong số đó đọc được tài liệu. Không một cái nào trong số tám cái đó có thể xem video.
Nhóm B — văn bản, hình ảnh và video, không có tệp: 29 mô hình. Giá đầu vào trung vị $0.25 mỗi triệu token. Hai mươi hai trong số hai mươi chín mô hình mang tiền tố Qwen; số còn lại là MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B và hai bản Qwen được tinh chỉnh cho Obsidian. Mức trần của nhóm này là Qwen3.8-Max ở mức $2.00 mỗi triệu — nghĩa là mô hình đọc video đắt nhất trong nhóm này có chi phí đúng bằng một nửa của Claude Opus 5.5.
Khoảng cách trung vị giữa hai phe là 8×. Khoảng cách về thành viên thậm chí còn rõ rệt hơn. Trong số 182 mô hình có công bố bề mặt đầu vào, 60 mô hình nhận tài liệu mà không nhận video, 32 mô hình nhận video mà không nhận tài liệu, 73 mô hình không nhận cả hai, và chỉ 17 mô hình nhận cả hai. Mức chồng lấn nhỏ đến mức hai nhóm trông như những sản phẩm gần như tách biệt hoàn toàn, và 17 mô hình ở giữa gần như toàn bộ đều thuộc tầng cao cấp của Google — mười lăm trong số mười bảy — cộng thêm hai bản dựng Muse Spark của Meta.

Có một lý do hợp lý cho hình dạng này. Hiểu tài liệu và hiểu video là những bài toán kỹ thuật khác nhau với những đường cong chi phí khác nhau, và những nhà cung cấp giải quyết video trước hầu hết là những bên bán token giá rẻ với số lượng hàng trăm triệu. Những nhà cung cấp giải quyết tài liệu trước là những bên bán khả năng suy luận với mức giá cao. Chưa ai bị buộc phải làm cả hai với cùng một mức giá, nên thị trường đã tách thành hai sản phẩm và định giá chúng cho phù hợp.
Mười chín kẻ lấy đi mọi thứ
Mười chín mô hình chấp nhận cả bốn loại đầu vào — văn bản, hình ảnh, video và âm thanh. Mười sáu mô hình là của Google, hai là của Meta, một là của MiniMax. Dải sản phẩm của chính Google trong nhóm đó trải từ 0,10 đô la mỗi triệu cho gemini-2.5-flash-lite đến 4,00 đô la cho gemini-pro-latest, nên "đọc được mọi thứ" không phải là một mức giá; đó là quyết định Google đưa ra ở mọi mức giá. Phần đóng góp của Meta là cặp bản dựng Muse Spark — Muse Spark 1.1 và Muse Spark 1.2, giống hệt nhau trong danh mục ở mức 1,25 đô la mỗi triệu đầu vào và 4,25 đô la đầu ra, với ngữ cảnh 1M token.
Đây là phe làm nổi bật luận điểm then chốt của bài viết: một pipeline hiểu video không cần một mô hình chủ lực. Nó chỉ cần chọn từ danh sách mười chín mô hình, trong đó mười mô hình tốn dưới một đô la cho mỗi triệu token đầu vào.
Năm mô hình trên bảng này phát ra thứ gì đó không phải văn bản.
Đọc video và tạo video là hai kỹ năng khác nhau, và kỹ năng thứ hai hiếm hơn. Trong số 204 mô hình, 139 công bố một bề mặt đầu ra; năm trong số đó nêu tên một thứ gì đó không phải văn bản.
Ba cái là trình tạo hình ảnh: Nano Banana (Gemini 2.5 Flash Image) với $0.30 đầu vào và $30.00 đầu ra trên mỗi triệu token, Nano Banana Pro (Gemini 3 Pro Image Preview) với $0.24 mỗi yêu cầu, và Nano Banana 2 (Gemini 3.1 Flash Image Preview) với $0.151 mỗi yêu cầu. Hai cái tạo video: MiniMax H3, tính phí theo mỗi giây đầu ra được tạo — $0.08 mỗi giây ở 768P và $0.13 ở 2K, cho các clip dài từ bốn đến mười lăm giây với âm thanh stereo gốc — và OrcaDub 1.0, tính phí $0.60 mỗi phút video nguồn, hỗ trợ 28 ngôn ngữ và nhân bản một giọng nói riêng cho mỗi người nói.
Hai cách hiểu cần tránh ở đây. Thứ nhất, 65 hàng còn lại để trống trường đầu ra; trống nghĩa là danh mục không ghi nhận một bề mặt đầu ra, và đó không phải là bằng chứng cho thấy một mô hình chỉ phát ra văn bản. Thứ hai, đọc video và tạo video là những trục riêng biệt gần như không chồng lấn trên bảng này — OrcaDub 1.0 nhận video đầu vào và trả lại video, khiến nó trở thành mô hình duy nhất ở đây có khả năng nằm ở cả hai đầu của một pipeline, trong khi MiniMax H3 nhận bốn loại đầu vào để tạo ra một loại đầu ra duy nhất không phải văn bản.
Định tuyến cái gì đến đâu
Bốn quy tắc rút ra từ cuộc điều tra, và chúng có chi phí áp dụng thấp.
• Nếu đầu vào của bạn là một clip, đừng vội nhắm đến một flagship tiên phong trước tiên. Nhóm đọc video mà không cần tài liệu có 29 mô hình, hai mươi hai trong số đó là Qwen, và trung vị của nó là một phần tư trên mỗi triệu. Thay vào đó, hãy gửi cho flagship các khung hình và bản chép lời, rồi để nó đảm nhiệm phần suy luận.
• Nếu đầu vào của bạn là PDF, hợp đồng hoặc tài liệu dài, thì phe video là phe sai. Chỉ có 17 mô hình khai báo cả đầu vào tệp và video, và mọi mô hình khai báo đầu vào tệp cũng khai báo đầu vào hình ảnh, vì vậy hai thứ này đi cùng nhau. Claude Opus 5.5 ở mức $4.00 mỗi triệu sẽ mua được khả năng hỗ trợ tài liệu cùng với cửa sổ 1M token, đó chính là sự đánh đổi bạn đang thực hiện.
• Nếu bạn cần đầu ra là phương tiện, bạn đang chọn từ năm mô hình, chứ không phải từ bảng. Ba mô hình tạo ảnh tĩnh và hai mô hình tạo video, và hai mô hình đó tính phí theo giây và theo phút thay vì theo token — nên một ước tính chi phí dựng từ giá đầu vào sẽ sai ngay từ cấu trúc.
• Nếu bạn cần đầu ra video và nguồn của bạn là một kịch bản, tạo mã vẫn là con đường rẻ nhất trên bảng này. Claude Opus 5.5 viết renderer với chi phí ngang văn bản; MiniMax H3 kết xuất nó với tám xu một giây. Ghép nối cả hai tốn ít hơn so với từng phương án thay thế và để lại cho bạn một tệp mà bạn có thể chỉnh sửa.
FAQ
Claude Opus 5.5 có thể xem video không?
Không. Các phương thức đầu vào được công bố của nó là văn bản, hình ảnh và tệp. Video không nằm trong số đó, và âm thanh cũng vậy. Bản ghi màn hình hoặc clip sản phẩm phải được chuyển đổi — khung hình lấy mẫu, bản chép lời, hoặc cả hai — trước khi có thể gửi đi.
Claude Opus 5.5 có tạo video trực tiếp không?
Không phải như một phương thức. Nó trả về văn bản, và văn bản đó thường là một chương trình khép kín có thể kết xuất chuyển động khi bạn chạy nó. Việc kết xuất là do bạn; mô hình không bao giờ phát ra một pixel nào. Nếu bạn muốn một mô hình trên bảng này tự trả về video, MiniMax H3 và OrcaDub 1.0 là hai mô hình đó.
"multimodal" có phải là một bậc giá không?
Không, và bảng này cho thấy lý do theo cả hai hướng. Google cung cấp đầy đủ tính năng đa phương thức bốn đầu vào từ 0,10 đô la cho mỗi triệu token đầu vào đến 4,00 đô la, trong khi mức giá đầu vào đồng hạng cao nhất trên bảng — openai/gpt-5.5-pro ở mức 30 đô la mỗi triệu — đọc được tài liệu và hình ảnh nhưng không đọc được video. Thứ bạn trả tiền là bậc suy luận, không phải số lượng phương thức.
Tại sao có quá ít mô hình đọc được tài liệu, trong khi lại có rất nhiều mô hình đọc được hình ảnh?
Vì tệp và hình ảnh luôn đi cùng nhau trên bảng này: tất cả 77 mô hình đọc tệp cũng đọc hình ảnh, nên đầu vào tệp là phần mở rộng của đầu vào hình ảnh chứ không phải một năng lực độc lập. Con số cần nhớ là 60 trong số 182 mô hình khai báo một bề mặt đầu vào nhận tài liệu và hình ảnh, và hoàn toàn không có video — một phần ba bảng, và cũng là nơi phân khúc flagship nằm.
Tôi nên định giá một pipeline video như thế nào?
Theo đơn vị mà model tính phí. Các trình đọc video được tính giá theo token, giống như bất kỳ chat model nào. Các trình tạo video trên bảng này được tính giá theo giây đầu ra (MiniMax H3: $0.08 ở 768P, $0.13 ở 2K) hoặc theo phút nguồn (OrcaDub 1.0: $0.60). Trộn hai đơn vị này vào một ước tính là cách phổ biến nhất khiến ngân sách video bị tính sai.
Câu cần ghi nhớ
Điều thú vị về Claude Opus 5.5 không phải là việc nó đa phương thức. Phần lớn bảng xếp hạng đều như vậy. Mà là ranh giới phương thức nằm ở một chỗ bất thường — tài liệu và ảnh tĩnh đầu vào, văn bản đầu ra, không có video theo cả hai chiều — trong khi những bản demo làm nên tên tuổi của nó lại là video. Hai sự thật đó không hề mâu thuẫn, và việc đọc chúng như một mâu thuẫn chính là điều khiến câu chuyện code-video trở nên khó hiểu. Mô hình viết ra một renderer; renderer tạo ra bộ phim. Thứ có thể đưa cho mô hình là một kịch bản, một tài liệu và một ảnh chụp màn hình.

Tất cả nội dung ở trên là ảnh chụp nhanh danh mục OrcaRouter vào ngày 2026-09-29 và các khai báo phương thức trong đó. Thông số kỹ thuật của nhà cung cấp thay đổi, và danh sách phương thức trên thẻ mô hình là thứ đầu tiên cần kiểm tra lại trước khi bạn dựa vào một con số. Nếu một tuyên bố ở đây quan trọng đối với một quyết định, hãy mở trang mô hình — các trường nằm trên đó.
