
Claude Opus 5.5 Multimodal: يُصيّر الفيديو من الكود، لكنه لا يستطيع مشاهدة أي فيديو
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 1009 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 195 tok/s
- OrcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- xAISpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
اطلب من Claude Opus 5.5 فيديو وقد ينتهي بك الأمر إلى واحد — برنامج من تعليمات HTML أو CSS أو canvas يرسم كل إطار، ثم تشغّله أنت. سلّمه فيديو واسأله عمّا يجري فيه فلن تحصل على أي شيء على الإطلاق، لأنه لا يوجد إدخال للفيديو. هذا التفاوت هو كامل سطح الوسائط لدى هذا النموذج، وهو متطابق في النماذج الأحد عشر كافة من Anthropic على لوحتنا، لذا يجدر قوله بصراحة: Claude Opus 5.5 يقرأ النصوص والصور والملفات، ويكتب النصوص، ويتوقف عند هذا الحد. أما اللوحة من حوله فهي أقل تجانسًا بكثير. MiniMax H3 يولّد الفيديو مباشرةً، OrcaDub 1.0 يستقبل فيديو ويعيد فيديو مدبلجًا، وQwen3.8-Max سيشاهد مقطعًا مقابل دولارين لكل مليون رمز إدخال — أي نصف ما يتقاضاه Claude Opus 5.5 عن المليون نفسه، وبقدرة لا يمتلكها.
هذه قراءة لسطر الوسائط كما يسجّله OrcaRouter في 2026-09-29، عبر جميع النماذج الـ204 في الكتالوج. الأرقام أدناه هي تصريحات الكتالوج، وليست اختباراتنا المرجعية — حقل الوسائط هو ما تقوله بطاقة النموذج، وبطاقات النماذج تتغير.
ما الذي يسجّله الكتالوج في الواقع
من بين النماذج الـ204، تُصرِّح 182 منها بواجهة إدخال. أما الـ22 الأخرى فتتركها فارغة، وهو تعبير عن السجل لا عن النموذج — ثمانية نماذج فيديو من Kling، وأربعة نماذج ميتا من OrcaRouter، ومجموعة متفرقة من نقاط النهاية المجانية ونقاط المعاينة بينها.

عبر تلك الـ182:
• 131 صورة مقروءة
• 77 يقرؤون الملفات — وكل واحد من هؤلاء الـ77 يقرأ الصور أيضًا، لذا فإن إدخال الملفات تعزيز لإدخال الصور على هذه اللوحة، وليس نمطًا سادسًا منفصلًا أبدًا
• 49 فيديو مقروء
• 19 استمع إلى الصوت
• 50 خذ النص ولا شيء آخر
Claude Opus 5.5 يقع ضمن خط الصور والملفات وليس ضمن خط الفيديو. تقول صفحة النموذج الخاصة بنا ذلك في جملة واحدة، تحت عنوان "السياق والوسائط والتفكير": إدخال متعدد الوسائط — نص وصور وملفات — مع إخراج نصي، ونافذة سياق بسعة 1M رمز، وحتى 128K رمز إخراج. هذا هو سطح الإدخال الكامل. لا يوجد مدخل خامس مختبئ في قائمة فرعية.
خمسون رقم أكبر مما يتوقعه معظم الناس. أكثر من ربع النماذج التي تُصرّح بأي شيء على الإطلاق لا تستقبل سوى النص، وهذا يعني أن خط معالجة مبنيًا على افتراض أنه قادر على إرفاق لقطة شاشة وجعلها مفهومة سيتعطل عند ربع هذه اللوحة.
لماذا لا يُعد "الفيديو مع الكود" وسيطًا فيديويًا؟
العروض التوضيحية التي انتشرت حقيقية، وكذلك التأثير: Claude Opus 5.5 بارع بشكل غير معتاد في كتابة برنامج يرسم الحركة — مُصيّر قائم بذاته ينتج إطارات عند تشغيله. هذه قدرة حقيقية ومفيدة. لكن ما ليس عليه هو كونه نمط إخراج. يسجّل الكتالوج مخرَجًا واحدًا بالضبط لهذا النموذج، وهو نص. يُصنَّع الفيديو في المرحلة اللاحقة، بواسطة الكود الذي كتبه النموذج، على جهازك، باستخدام المُصيّر الخاص بك.
النتيجة العملية ذات وجهين، والنصف الثاني هو النصف الذي يفوته الناس.
عند الخروج، تتحمل مسؤولية خطوة التصيير. الفيديو القائم على الشيفرة قابل للفحص، وقابل لإظهار الفروق، وقابل لإعادة التشغيل بدقة مختلفة، ورخيص بالطريقة التي يكون بها الرد النصي رخيصًا — بضعة دولارات من الرموز بدلًا من عدّاد فوترة لكل ثانية. كما تتحمل مسؤولية كل إخفاق: خط مفقود، أو ميزانية إطارات سيئة، أو محرّك تصيير يخالف الشيفرة التي سُلّمها.
عند الإدخال، لا يوجد شيء يمكن تسليمه إليه. إذا كانت مادتك المصدرية تسجيلًا للشاشة، أو مقطعًا لمنتج، أو ندوة عبر الإنترنت مدتها ساعتان، أو فيلم إطلاق لمنافس، Claude Opus 5.5 فلا يمكنه النظر إليه. ما يمكنك إرساله هو النص المكتوب، أو الشرائح كإطارات ثابتة، أو وصف كتبه شخص آخر. هذا هو القيد الذي يحدد البنى المعمارية فعليًا، وهو غير مرئي في مقطع عرض تجريبي.
فريقان: 60 نموذجًا يتلقون المستند، و29 يتلقون المقطع
جمّع النماذج الـ182 حسب مجموعة المدخلات الدقيقة الخاصة بها، فتنفصل اللوحة إلى مجموعتين لا تكادان تتقاطعان.
المعسكر A — مستندات وصور، بلا فيديو: 60 نموذجًا. السعر الوسيط للمُدخلات 2.00 دولار لكل مليون رمز. وهنا يقع Claude Opus 5.5، إلى جانب نماذج Anthropic الأحد عشر جميعها، وثلاثة من صفوف Grok الخمسة، والطرف الخاص بالاستدلال في كتالوج OpenAI — كل صف من GPT-4.1 وGPT-6، وفي عائلتي GPT-4o وGPT-5 كل شيء عدا المتغيّرات الخاصة بالصوت وcodex والبحث وchat-latest. ويحتل المعسكر A أيضًا سقف جدول الأسعار: openai/gpt-5.5-pro وopenai/gpt-5.4-pro بسعر 30 دولارًا لكل مليون رمز مُدخل. وهذا هو أعلى سعر للمُدخلات على اللوحة كلها، وهو سعر تشترك فيه مع صفّين من صفوف GPT-4 التابعة لـ OpenAI ونقطتي نهاية للتحويل من النص إلى الكلام، ولا يقرأ أيٌّ منها أي مستند. ولا يستطيع أيٌّ من الثمانية مشاهدة فيديو.
المجموعة B — نص وصور وفيديو، بدون ملفات: 29 نموذجًا. سعر الإدخال الوسيط 0.25 دولار لكل مليون توكن. اثنان وعشرون من أصل تسعة وعشرين يحملون بادئة Qwen؛ والباقي: MiniMax M3، GLM-5.3-Flash، Kimi K2.6، Kimi K2.7-Code، Gemma 4 26B ونسختان من Qwen مضبوطتان على Obsidian. حدّها الأقصى هو Qwen3.8-Max عند 2.00 دولار لكل مليون — أي أن أغلى نموذج لقراءة الفيديو في هذه المجموعة يكلف بالضبط نصف Claude Opus 5.5.
الفجوة الوسيطية بين المعسكرين هي 8×. الفجوة في العضوية أكثر وضوحًا. من بين 182 نموذجًا تعلن عن سطح إدخال، 60 يقبلون المستندات وليس الفيديو، 32 يقبلون الفيديو وليس المستندات، 73 لا يقبلون أي منهما، و17 فقط يقبلون كليهما. التداخل صغير بما يكفي لتبدو المجموعتان كمنتجات شبه منفصلة، و17 في المنتصف هم تقريبًا بالكامل من الطبقة العليا من Google — خمسة عشر من السبعة عشر — بالإضافة إلى إصداري Muse Spark من Meta.

ثمة سبب معقول وراء هذا الشكل. ففهم المستندات وفهم الفيديو مشكلتان هندسيتان مختلفتان بمنحنيات تكلفة مختلفة، والبائعون الذين حلّوا مشكلة الفيديو أولاً هم، في الغالب، من يبيعون الرموز الرخيصة بمئات الملايين. أما البائعون الذين حلّوا مشكلة المستندات أولاً فهم من يبيعون الاستدلال بسعر مرتفع. ولم يُضطَر أحد بعد إلى القيام بالأمرين بالسعر نفسه، فانقسم السوق إلى منتجين وسُعِّرا وفقاً لذلك.
التسعة عشر الذين يأخذون كل شيء
تسعة عشر نموذجًا تقبل جميع أنواع المدخلات الأربعة — النص والصورة والفيديو والصوت. ستة عشر منها من Google، اثنان من Meta، وواحد من MiniMax. تتراوح مجموعة Google الخاصة داخل هذا المعسكر من 0.10 دولار لكل مليون لـ gemini-2.5-flash-lite إلى 4.00 دولار لـ gemini-pro-latest، لذا فإن "يقرأ كل شيء" ليس فئة سعرية؛ بل هو قرار اتخذته Google عند كل نقطة سعرية. مساهمة Meta هي زوج من إصدارات Muse Spark — Muse Spark 1.1 و Muse Spark 1.2، متطابقان في الكتالوج بسعر 1.25 دولار لكل مليون للمدخلات و 4.25 دولار للمخرجات، مع سياق يبلغ مليون رمز.
هذا هو المعسكر الذي يطرح النقطة العملية للمقال: فمسار المعالجة المدرك للفيديو لا يتطلب نموذجًا رائدًا. بل يتطلب الاختيار من قائمة تضم تسعة عشر نموذجًا، عشرة منها تكلف أقل من دولار لكل مليون رمز إدخال.
تُصدِر خمسة نماذج على هذه اللوحة شيئًا آخر غير النص.
قراءة الفيديو وإنتاجه مهارتان مختلفتان، والثانية أندر. من بين النماذج الـ204، 139 تعلن عن وجود سطح إخراج؛ خمسة منها تسمّي شيئًا آخر غير النص.
ثلاثة منها مولّدات صور: Nano Banana (Gemini 2.5 Flash Image) بسعر 0.30 دولار للإدخال و30.00 دولارًا للإخراج لكل مليون توكن، Nano Banana Pro (Gemini 3 Pro Image Preview) بسعر 0.24 دولار لكل طلب، وNano Banana 2 (Gemini 3.1 Flash Image Preview) بسعر 0.151 دولار لكل طلب. اثنان ينتجان فيديو: MiniMax H3، تُحتسب التكلفة لكل ثانية من المخرجات المولّدة — 0.08 دولار لكل ثانية عند 768P و0.13 دولار عند 2K، لمقاطع من أربع إلى خمس عشرة ثانية مع صوت ستيريو أصلي — وOrcaDub 1.0، تُحتسب بسعر 0.60 دولار لكل دقيقة من الفيديو المصدر، وتغطي 28 لغة وتستنسخ صوتًا منفصلًا لكل متحدث.
ثمة تأطيران يجب تجنبهما هنا. أولاً، الصفوف الـ65 المتبقية تترك حقل الإخراج فارغاً؛ الفراغ يعني أن الكتالوج لا يسجل سطح إخراج، وليس دليلاً على أن نموذجاً ما لا يصدر سوى نص. ثانياً، قراءة الفيديو وصناعة الفيديو محوران منفصلان لا يكادان يتداخلان على هذه اللوحة — OrcaDub 1.0 يستقبل الفيديو ويعيد الفيديو، ما يجعله النموذج الوحيد هنا الذي يقع على نحو معقول عند طرفي خط أنابيب، بينما MiniMax H3 يستقبل أربعة أنواع من المدخلات لإنتاج نوع إخراج واحد ليس نصاً.
ما الذي يُوجَّه إلى أين؟
تنتج عن التعداد أربع قواعد، وتطبيقها غير مكلف.
• إذا كان مُدخلك مقطعًا، فلا تلجأ إلى نموذج رائد متطور أولًا. الفئة التي تقرأ الفيديو دون الحاجة إلى مستندات تضم 29 نموذجًا، اثنان وعشرون منها Qwen، ووسيطها ربع لكل مليون. أرسل إلى النموذج الرائد الإطارات والنص المكتوب بدلاً من ذلك، ودعه يقوم بالاستدلال.
• إذا كان مُدخلك ملف PDF أو عقدًا أو مستندًا طويلًا، فإن معسكر الفيديو هو المعسكر الخاطئ. 17 نموذجًا فقط تعلن عن دعم كلٍّ من إدخال الملفات والفيديو، وكل نموذج يعلن عن دعم إدخال الملفات يعلن أيضًا عن دعم إدخال الصور، لذا فإن الاثنين يسيران معًا. Claude Opus 5.5 مقابل 4.00 دولارات لكل مليون يمنحك دعم المستندات بالإضافة إلى نافذة سعة مليون توكن، وهذه هي المقايضة التي تعقدها.
• إذا كنت بحاجة إلى إخراج وسائط، فأنت تختار من بين خمسة نماذج، لا من اللوحة. ثلاثة منها تنتج صورًا ثابتة واثنان ينتجان فيديو، وهذان يُحاسبان بالثانية وبالدقيقة وليس بالتوكن — لذا فإن تقدير التكلفة المبني على أسعار المدخلات سيكون خاطئًا بحكم بنيته.
• إذا كنت بحاجة إلى إخراج فيديو وكان مصدرك نصًا برمجيًا، فإن توليد الشيفرة يبقى أرخص مسار على هذه اللوحة. Claude Opus 5.5 يكتب أداة التصيير بسعر النص؛ MiniMax H3 يصيّره مقابل ثمانية سنتات في الثانية. ربط الاثنين معًا يكلّف أقل من أيٍّ من البديلين ويترك لك ملفًا يمكنك تعديله.
الأسئلة الشائعة
هل يستطيع Claude Opus 5.5 مشاهدة مقطع فيديو؟
لا. أنماط الإدخال المُعلنة له هي النص والصورة والملف. الفيديو ليس من بينها، ولا الصوت كذلك. يجب تحويل تسجيل الشاشة أو مقطع منتج — إطارات مُعيّنة، أو نص مكتوب، أو كليهما — قبل أن يُمكن إرساله.
هل يقوم Claude Opus 5.5 بإنشاء الفيديو مباشرةً؟
ليس بوصفه نمطًا. إنه يُعيد نصًا، وهذا النص غالبًا ما يكون برنامجًا قائمًا بذاته يُصيّر الحركة عند تشغيله. التصيير مسؤوليتك؛ فلا يُصدر النموذج بكسلًا قط. إذا أردت نموذجًا على هذه اللوحة يُعيد الفيديو بنفسه، MiniMax H3 وOrcaDub 1.0 هما الاثنان.
هل تُعدّ "multimodal" فئة سعرية؟
لا، وتوضّح اللوحة السبب في كلا الاتجاهين. توفّر Google تعددية وسائط كاملة بأربعة مدخلات من 0.10 دولار لكل مليون رمز إدخال إلى 4.00 دولارات، بينما أعلى سعر إدخال مشترك على اللوحة — openai/gpt-5.5-pro عند 30 دولارًا لكل مليون — يقرأ المستندات والصور ولكن ليس الفيديو. ما تدفع مقابله هو طبقة الاستدلال، وليس عدد الوسائط.
لماذا تقرأ نماذج قليلة جدًا المستندات بينما تقرأ نماذج كثيرة الصور؟
لأن الملفات والصور تسيران معًا على هذه اللوحة: فكل النماذج الـ77 القارئة للملفات تقرأ الصور أيضًا، لذا فإن إدخال الملفات امتداد لإدخال الصور وليس قدرة مستقلة. الرقم الجدير بالتذكر هو أن 60 من أصل 182 نموذجًا تعلن عن سطح إدخال تقبل المستندات والصور ولا فيديو على الإطلاق — أي ثلث اللوحة، وحيث تقع الفئة الرائدة.
كيف ينبغي لي تسعير خط أنابيب فيديو؟
بحسب الوحدة التي يعتمدها النموذج في الفوترة. تُسعَّر قارئات الفيديو لكل رمز (توكن)، مثل أي نموذج محادثة. أما مولّدات الفيديو على هذه اللوحة فتُسعَّر لكل ثانية من الإخراج (MiniMax H3: $0.08 عند 768P، و$0.13 عند 2K) أو لكل دقيقة من المصدر (OrcaDub 1.0: $0.60). خلط الوحدتين في تقدير واحد هو أكثر الطرق شيوعًا لظهور ميزانية الفيديو بشكل خاطئ.
الجملة التي يجب تذكرها
الشيء المثير للاهتمام في Claude Opus 5.5 ليس أنه متعدد الوسائط. فمعظم الطُرز في الساحة كذلك. بل إن خط الوسائط يقع في موضع غير معتاد: المستندات والصور الثابتة تدخل، والنص يخرج، ولا فيديو في أيٍّ من الاتجاهين — بينما العروض التوضيحية التي جعلته شهيرًا هي فيديو. وهاتان الحقيقتان لا تتعارضان، وقراءتهما على أنهما متعارضتان هي ما يجعل قصة الكود-فيديو مربكة. النموذج يكتب برنامج تصيير؛ وبرنامج التصيير يصنع الفيلم. وما يمكن أن يُسلَّم إلى النموذج هو سكربت ومستند ولقطة شاشة.

كل ما ورد أعلاه هو لقطة من كتالوج OrcaRouter بتاريخ 2026-09-29 وإعلانات الوسائط الواردة فيه. تتغيّر مواصفات المورّدين، وقائمة الوسائط في بطاقة النموذج هي أول ما يجب إعادة التحقق منه قبل أن تبني على رقم. إذا كان ادّعاء هنا مهمًا لقرار، فافتح صفحة النموذج — فالحقول موجودة عليها.
