
Claude Opus 5.5 מולטימודלי: הוא מרנדר וידאו מקוד, ואינו יכול לצפות באחד
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 1009 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 195 tok/s
- OrcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
בקשוClaude Opus 5.5 לייצר סרטון ואולי תקבלו אחד — תוכנית של HTML, CSS או קריאות קנבס שמציירת כל פריים, שאותה תריצו afterwards. תנו לו סרטון ושאלו מה קורה בו ולא תקבלו דבר, כי אין קלט וידאו. האסימטריה הזאת היא כל משטח המודאליות של המודל הזה, והיא זהה בכל אחד-עשר מודלי Anthropic שבלוח שלנו, ולכן ראוי להצהיר על כך בפשטות: Claude Opus 5.5 קורא טקסט, תמונות וקבצים, כותב טקסט, ומסתפק בכך. הלוח שסביבו הרבה פחות אחיד. MiniMax H3 מייצר וידאו ממש, OrcaDub 1.0 מקבל סרטון ומחזיר סרטון מדובב, וQwen3.8-Max יצפה בקליפ תמורת שני דולרים למיליון טוקני קלט — חצי ממה שClaude Opus 5.5 גובה עבור אותו מיליון, ועם יכולת שאין לו.
זהו תיעוד של שורת המודאליות כפי ש-OrcaRouter רושם אותה בתאריך 2026-09-29, בכל 204 המודלים בקטלוג. המספרים שלהלן הם הצהרות קטלוג, לא מבחני הביצוע שלנו — שדה מודאליות הוא מה שכרטיס המודל אומר, וכרטיסי מודלים משתנים.
מה שהקטלוג למעשה מתעד
מתוך 204 המודלים, 182 מצהירים על משטח קלט. 22 האחרים משאירים אותו ריק, וזו אמירה על הרשומה ולא על המודל — שמונה מודלי וידאו של Kling, ארבעה מטא-מודלים של OrcaRouter, וכמה נקודות קצה מהשכבה החינמית ומתצוגה מקדימה ביניהם.

לאורך אותם 182:
• 131 תמונות שנקראו
• 77 קוראים קבצים — וכל אחד מאותם 77 קורא גם תמונות, כך שקלט קבצים הוא חיזוק של קלט תמונות בלוח הזה, ולעולם לא מודאליות שישית נפרדת
• 49 סרטונים שנקראו
• 19 שמע אודיו
• 50 קח טקסט ולא שום דבר אחר
Claude Opus 5.5 נמצא בקו התמונות והקבצים ולא בקו הווידאו. עמוד המודל שלנו אומר זאת במשפט אחד, תחת הכותרת "הקשר, מודאליות וחשיבה": קלט מולטימודלי — טקסט, תמונות וקבצים — עם פלט טקסט, חלון הקשר של מיליון טוקנים ועד 128 אלף טוקני פלט. זהו משטח הקלט המלא. אין רשומה חמישית שמסתתרת בתפריט משנה.
חמישים הוא מספר גדול יותר ממה שרוב האנשים מצפים. יותר מרבע מהמודלים שמצהירים על משהו בכלל תומכים בטקסט בלבד, מה שאומר שפייפליין שנבנה מתוך הנחה שהוא יכול לצרף צילום מסך ושהוא יובן יישבר על רבע מהלוח הזה.
למה "וידאו עם קוד" אינו מודאליות וידאו
ההדגמות שנפוצו הן אמיתיות, וכך גם האפקט: Claude Opus 5.5 טוב באופן יוצא דופן בכתיבת תוכנית שמציירת תנועה — מנוע רינדור עצמאי שמייצר פריימים כשאתה מריץ אותו. זוהי יכולת אמיתית ושימושית. מה שזה לא — זו מודאליות פלט. הקטלוג מתעד בדיוק פלט אחד עבור המודל הזה, והוא טקסט. הווידאו מיוצר בהמשך התהליך, על ידי הקוד שהמודל כתב, במחשב שלך, עם מנוע הרינדור שלך.
להשלכה המעשית יש פנים לכאן ולכאן, והמחצית השנייה היא זו שאנשים מפספסים.
בדרך החוצה, באחריותך שלב הרינדור. וידאו מבוסס קוד ניתן לבדיקה, ניתן להשוואה, ניתן להרצה מחדש ברזולוציה אחרת, והוא זול באותו אופן שבו תגובת טקסט זולה — כמה דולרים של טוקנים ולא מונה חיוב לפי שנייה. באחריותך גם כל כשל: גופן חסר, תקציב פריימים גרוע, מרנדר שלא מסכים עם הקוד שנמסר לו.
בדרך פנימה, אין מה למסור לו. אם חומר המקור שלך הוא הקלטת מסך, קליפ של מוצר, וובינר של שעתיים, או סרט ההשקה של מתחרה, Claude Opus 5.5 לא יכול להסתכל עליו. מה שאתה יכול לשלוח זה את התמלול, את השקפים כתמונות סטטיות, או תיאור שמישהו אחר כתב. זה האילוץ שבפועל מכריע ארכיטקטורות, והוא בלתי נראה בסרטון הדגמה.
שני מחנות: 60 מודלים מקבלים את המסמך, 29 מקבלים את הקליפ
קבץ את 182 המודלים לפי קבוצת הקלט המדויקת שלהם, והלוח מתפצל לשתי קבוצות שכמעט ואינן חופפות.
מחנה A — מסמכים ותמונות, ללא וידאו: 60 מודלים. מחיר קלט חציוני 2.00$ למיליון טוקנים. כאן Claude Opus 5.5 יושב, לצד כל אחד-עשר המודלים של Anthropic, שלוש מתוך חמש שורות ה-Grok, וקצה ההיסק של קטלוג OpenAI — כל שורה של GPT-4.1 ו-GPT-6, ובמשפחות GPT-4o ו-GPT-5 הכול מלבד וריאנטים של voice, codex, search ו-chat-latest. מחנה A מחזיק גם את התקרה של טבלת המחירים: openai/gpt-5.5-pro ו-openai/gpt-5.4-pro במחיר של 30$ למיליון טוקני קלט. זהו מחיר הקלט הגבוה ביותר בכל הלוח, והוא מחיר שהם חולקים עם שתי שורות GPT-4 של OpenAI ושתי נקודות קצה של טקסט-לדיבור, שאף אחת מהן אינה קוראת מסמך. אף אחד מהשמונה לא יכול לצפות בווידאו.
מחנה B — טקסט, תמונות ווידאו, ללא קבצים: 29 מודלים. מחיר קלט חציוני 0.25 דולר למיליון טוקנים. עשרים ושניים מתוך עשרים ותשעה נושאים קידומת Qwen; השאר הם MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B ושני מבני Qwen מכוונני Obsidian. התקרה שלו היא Qwen3.8-Max ב-2.00 דולר למיליון — כלומר, המודל היקר ביותר לקריאת וידאו במחנה הזה עולה בדיוק חצי מ-Claude Opus 5.5.
הפער החציוני בין המחנות הוא 8×. הפער בהשתייכות חד אף יותר. מתוך 182 המודלים שמצהירים על משטח קלט, 60 מקבלים מסמכים ולא וידאו, 32 מקבלים וידאו ולא מסמכים, 73 לא מקבלים אף אחד מהשניים, ורק 17 מקבלים את שניהם. החפיפה קטנה מספיק כדי ששתי הקבוצות ייתפסו כמוצרים כמעט זרים, וה-17 שבאמצע הם כמעט כולם מהדרג העליון של Google — חמישה עשר מתוך השבעה עשר — בתוספת שני הבילדים של Muse Spark של Meta.

יש סיבה סבירה לצורה. הבנת מסמכים והבנת וידאו הן בעיות הנדסיות שונות עם עקומות עלות שונות, והספקים שפתרו את הווידאו ראשונים הם, ברובם, אלה שמוכרים טוקנים זולים בכמויות של מאות מיליונים. הספקים שפתרו את המסמכים ראשונים הם אלה שמוכרים הסקה במחיר גבוה. אף אחד עדיין לא נאלץ לעשות את שניהם באותו מחיר, ולכן השוק התפצל לשני מוצרים ותמחר אותם בהתאם.
התשעה עשר שלוקחים הכל
תשעה עשר מודלים מקבלים את כל ארבעת סוגי הקלט — טקסט, תמונה, וידאו ואודיו. שישה עשר הם של Google, שניים של Meta, אחד של MiniMax. הטווח של Google עצמה בתוך אותה קבוצה נע מ-0.10$ למיליון עבור gemini-2.5-flash-lite ועד 4.00$ עבור gemini-pro-latest, כך ש"קורא הכול" אינו דרגת מחיר; זו החלטה ש-Google קיבלה בכל נקודת מחיר. התרומה של Meta היא צמד הגרסאות של Muse Spark — Muse Spark 1.1 ו-Muse Spark 1.2, זהים בקטלוג ב-1.25$ למיליון בקלט ו-4.25$ בפלט, עם חלון הקשר של מיליון טוקנים.
זהו המחנה שממחיש את הנקודה המעשית של המאמר: צינור עיבוד מודע לווידאו אינו מצריך דגם דגל. הוא מצריך בחירה מתוך רשימה של תשעה עשר, שעשרה מהם עולים פחות מדולר למיליון טוקני קלט.
חמישה מודלים בלוח הזה פולטים משהו שאינו טקסט
לקרוא וידאו וליצור אותו הם טריקים שונים, והשני נדיר יותר. מבין 204 המודלים, 139 מצהירים על משטח פלט; חמישה מהם מציינים משהו שאינו טקסט.
שלושה הם מחוללי תמונות: Nano Banana (Gemini 2.5 Flash Image) בעלות של $0.30 לקלט ו-$30.00 לפלט למיליון טוקנים, Nano Banana Pro (Gemini 3 Pro Image Preview) במחיר $0.24 לבקשה, וNano Banana 2 (Gemini 3.1 Flash Image Preview) במחיר $0.151 לבקשה. שניים מפיקים וידאו: MiniMax H3, מחויב לפי שנייה של פלט מיוצר — $0.08 לשנייה ב-768P ו-$0.13 ב-2K, עבור קליפים של ארבע עד חמש עשרה שניות עם שמע סטריאו מקורי — וOrcaDub 1.0, מחויב ב-$0.60 לדקה של וידאו מקור, מכסה 28 שפות ומשכפל קול נפרד לכל דובר.
שתי מסגרות שיש להימנע מהן כאן. ראשית, 65 השורות הנותרות משאירות את שדה הפלט ריק; ריק משמעו שהקטלוג אינו מתעד משטח פלט, וזה אינו ראיה שמודל פולט טקסט בלבד. שנית, קריאת וידאו ויצירת וידאו הן צירים נפרדים שכמעט ואין ביניהם חפיפה בלוח הזה — OrcaDub 1.0 קולט וידאו ומחזיר וידאו, מה שהופך אותו למודל היחיד כאן שיכול באופן סביר לשבת בשני קצותיו של צינור עיבוד, בעוד MiniMax H3 קולט ארבעה סוגי קלט כדי להפיק סוג פלט יחיד שאינו טקסט.
מה לנתב לאן
ארבעה כללים נובעים מהמפקד, והם זולים ליישום.
• אם הקלט שלך הוא קליפ, אל תפנה תחילה לדגם דגל חזיתי. המחנה שקורא וידאו בלי להזדקק למסמכים מונה 29 מודלים, עשרים ושניים מהם Qwen, והחציון שלו הוא רבע למיליון. במקום זאת, שלח לדגם הדגל את הפריימים ואת התמלול, ותן לו לבצע את ההסקה.
• אם הקלט שלך הוא PDF, חוזה או מסמך ארוך, מחנה הווידאו הוא המחנה הלא נכון.רק 17 מודלים מצהירים גם על קלט קבצים וגם על קלט וידאו, וכל מודל שמצהיר על קלט קבצים מצהיר גם על קלט תמונות, כך ששני אלה הולכים יחד.Claude Opus 5.5ב-4.00 דולר למיליון קונה את משטח המסמכים בתוספת חלון של מיליון טוקנים, וזו העסקה שאתה עושה.
•אם אתם זקוקים לפלט, אתם בוחרים מבין חמישה מודלים, ולא מהלוח. שלושה מייצרים תמונות סטילס ושניים מייצרים וידאו, ושני אלה מחייבים לפי שנייה ולפי דקה ולא לפי טוקן — כך שאומדן עלות שנבנה מטוקנים יהיה שגוי מעצם הגדרתו.
• אם אתם צריכים פלט וידאו והמקור שלכם הוא תסריט, יצירת קוד נשארת הדרך הזולה ביותר בלוח הזה. Claude Opus 5.5 כותב את הרנדרר במחיר של טקסט; MiniMax H3 מרנדר אותו בשמונה סנטים לשנייה. שרשור השניים עולה פחות מכל אחת מהחלופות ומשאיר לכם קובץ שאפשר לערוך.
שאלות נפוצות
האם Claude Opus 5.5 יכול לצפות בסרטון?
לא. מודאליות הקלט המוצהרות שלו הן טקסט, תמונה וקובץ. וידאו אינו ביניהן, וגם לא אודיו. הקלטת מסך או קליפ מוצר חייבים לעבור המרה — פריימים מדוגמים, תמלול, או שניהם — לפני שניתן לשלוח אותם.
האם Claude Opus 5.5 מייצר וידאו ישירות?
לא כמודאליות. הוא מחזיר טקסט, ולעתים קרובות הטקסט הזה הוא תוכנית עצמאית שמרנדרת תנועה כשמריצים אותה. הרינדור הוא שלך; המודל לעולם לא פולט פיקסל. אם אתה רוצה מודל בלוח הזה שמחזיר וידאו בעצמו, MiniMax H3 וOrcaDub 1.0 הם השניים.
האם "multimodal" היא רמת מחיר?
לא, והלוח מראה מדוע בשני הכיוונים. Google מספקת מולטימודליות מלאה של ארבעה קלטים מ-$0.10 למיליון טוקני קלט ועד $4.00, בעוד שמחיר הקלט הגבוה ביותר במשותף בלוח — openai/gpt-5.5-pro ב-$30 למיליון — קורא מסמכים ותמונות אך לא וידאו. מה שאתה משלם עליו הוא שכבת ההסקה, לא מספר המודאליות.
מדוע כל כך מעט מודלים קוראים מסמכים אם כל כך רבים קוראים תמונות?
מכיוון שקבצים ותמונות נעים יחד בלוח הזה: כל 77 המודלים שקוראים קבצים קוראים גם תמונות, כך שקלט קבצים הוא הרחבה של קלט תמונות ולא יכולת עצמאית. המספר שכדאי לזכור הוא ש-60 מתוך 182 המודלים שמצהירים על משטח קלט מקבלים מסמכים ותמונות, ובלי וידאו בכלל — שליש מהלוח, וזה המקום שבו נמצאת דרגת הדגל.
איך כדאי לי לתמחר פייפליין וידאו?
לפי היחידה שבה המודל מחייב. קוראי וידאו מתומחרים לפי טוקן, כמו כל מודל צ׳אט. מחוללי וידאו בלוח הזה מתומחרים לפי שנייה של פלט (MiniMax H3: $0.08 ב-768P, $0.13 ב-2K) או לפי דקה של מקור (OrcaDub 1.0: $0.60). ערבוב שתי היחידות לאומדן אחד הוא הדרך הנפוצה ביותר שבה תקציב וידאו יוצא שגוי.
השורה שכדאי לזכור
הדבר המעניין לגבי Claude Opus 5.5הוא לא שהוא מולטימודלי. רוב הלוח הוא כזה. אלא שקו המודאליות נופל במקום יוצא דופן — מסמכים ותמונות נייחות נכנסים, טקסט יוצא, אין וידאו באף כיוון — בעוד שהדמואים שהפכו אותו למפורסם הם וידאו. שתי העובדות האלה אינן סותרות זו את זו, וקריאה שלהן כסתירה היא מה שהופך את סיפור הקוד-וידאו למבלבל. המודל כותב רנדרר; הרנדרר יוצר את הסרט. מה שאפשר למסור למודל הוא תסריט, מסמך וצילום מסך.

כל מה שלמעלה הוא תמונת מצב של הקטלוג של OrcaRouter מתאריך 2026-09-29 והצהרות המודאליות שבו. מפרטי ספקים משתנים, ורשימת המודאליות בכרטיס דגם היא הדבר הראשון שיש לבדוק מחדש לפני שמסתמכים על מספר. אם טענה כלשהי כאן חשובה להחלטה, פתחו את עמוד הדגם — השדות נמצאים בו.
