
Claude Opus 5.5 Multimodal: เรนเดอร์วิดีโอจากโค้ดได้ แต่กลับดูวิดีโอเองไม่ได้
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 1009 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 195 tok/s
- Orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
ขอ Claude Opus 5.5 ให้สร้างวิดีโอ แล้วคุณอาจได้มาหนึ่งชิ้น — โปรแกรมของ HTML, CSS หรือการเรียก canvas ที่วาดทุกเฟรม ซึ่งคุณก็รันมัน จากนั้นส่งวิดีโอให้มันแล้วถามว่าเกิดอะไรขึ้นในนั้น คุณจะไม่ได้อะไรเลย เพราะไม่มีอินพุตวิดีโอ ความไม่สมมาตรนี้คือพื้นผิวมอดาลิตี้ทั้งหมดของโมเดลนี้ และมันเหมือนกันบนโมเดล Anthropic ทั้งสิบเอ็ดตัวบนบอร์ดของเรา จึงควรพูดให้ชัดเจนว่า: Claude Opus 5.5 อ่านข้อความ รูปภาพ และไฟล์ เขียนข้อความ และหยุดแค่นั้น บอร์ดรอบๆ มันไม่สม่ำเสมอเท่าไหร่ MiniMax H3 สร้างวิดีโอได้เลย OrcaDub 1.0 รับวิดีโอเข้าไปแล้วคืนวิดีโอที่พากย์เสียงแล้ว และ Qwen3.8-Max จะดูคลิปในราคาสองดอลลาร์ต่อล้านโทเค็นอินพุต — ครึ่งหนึ่งของที่ Claude Opus 5.5 คิดในราคาเดียวกัน และด้วยความสามารถที่มันไม่มี
นี่คือการอ่านค่าแนว modality ตามที่ OrcaRouter บันทึกไว้เมื่อวันที่ 2026-09-29 ครอบคลุมทุกโมเดล 204 รายการในแคตตาล็อก ตัวเลขด้านล่างเป็นคำประกาศในแคตตาล็อก ไม่ใช่ผลทดสอบของเรา — ฟิลด์ modality คือสิ่งที่การ์ดโมเดลระบุ และการ์ดโมเดลเปลี่ยนแปลงได้
สิ่งที่แค็ตตาล็อกบันทึกไว้จริง ๆ
ในบรรดา 204 โมเดล 182 โมเดลประกาศพื้นผิวอินพุต ส่วนอีก 22 โมเดลปล่อยให้ว่างไว้ ซึ่งเป็นข้อความเกี่ยวกับบันทึกข้อมูลมากกว่าเกี่ยวกับตัวโมเดล — แปดโมเดลวิดีโอ Kling สี่เมตาโมเดล OrcaRouter และปลายทางแบบฟรีและพรีวิวที่กระจัดกระจายอยู่ท่ามกลางพวกมัน

ในบรรดา 182 รายการเหล่านั้น:
• อ่านรูปภาพแล้ว 131 รูป
• อ่านไฟล์ได้ 77 ตัว — และทั้ง 77 ตัวนั้นก็อ่านรูปภาพได้ด้วย ดังนั้นการป้อนไฟล์จึงเป็นการเสริมความแข็งแกร่งให้กับการป้อนรูปภาพบนบอร์ดนี้ ไม่ใช่โมดัลลิตี้ที่หกแยกต่างหากเลย
• อ่านวิดีโอ 49
• 19 ฟังเสียง
• 50 รับข้อความและไม่มีอย่างอื่น
Claude Opus 5.5อยู่ในกลุ่มรูปภาพและไฟล์ ไม่ได้อยู่ในกลุ่มวิดีโอ หน้าโมเดลของเราเองระบุไว้ในประโยคเดียว ภายใต้หัวข้อ "บริบท มัลติโมดัล และการคิด" ว่า: อินพุตแบบมัลติโมดัล — ข้อความ รูปภาพ และไฟล์ — พร้อมเอาต์พุตเป็นข้อความ หน้าต่างบริบท 1M โทเคน และเอาต์พุตสูงสุด 128K โทเคน นั่นคือพื้นผิวอินพุตทั้งหมด ไม่มีรายการที่ห้าซ่อนอยู่ในเมนูย่อย
ห้าสิบเป็นจำนวนที่มากกว่าที่คนส่วนใหญ่คาดไว้ มากกว่าหนึ่งในสี่ของโมเดลที่ประกาศข้อมูลใด ๆ ออกมานั้นรับเฉพาะข้อความ ซึ่งหมายความว่าไปป์ไลน์ที่สร้างขึ้นบนสมมติฐานว่าสามารถแนบภาพหน้าจอและให้มันถูกเข้าใจได้จะพังเมื่อใช้กับหนึ่งในสี่ของบอร์ดนี้
ทำไม "วิดีโอที่มีโค้ด" จึงไม่ใช่โมดัลลิตี้ประเภทวิดีโอ
เดโมที่ถูกแชร์กันไปทั่วนั้นมีอยู่จริง และผลลัพธ์ก็เช่นกัน: Claude Opus 5.5 เก่งเป็นพิเศษในการเขียนโปรแกรมที่วาดการเคลื่อนไหว — เรนเดอร์เรอร์ที่สมบูรณ์ในตัวเองซึ่งสร้างเฟรมเมื่อคุณรันมัน นั่นคือความสามารถที่มีอยู่จริงและมีประโยชน์ สิ่งที่มันไม่ใช่คือรูปแบบเอาต์พุต แค็ตตาล็อกบันทึกเอาต์พุตไว้เพียงหนึ่งรายการสำหรับโมเดลนี้ และนั่นคือ ข้อความ วิดีโอถูกสร้างขึ้นในขั้นถัดไป โดยโค้ดที่โมเดลเขียน บนเครื่องของคุณ ด้วยเรนเดอร์เรอร์ของคุณ
ผลในทางปฏิบัติย่อมมีสองด้าน และครึ่งหลังคือครึ่งที่ผู้คนมองข้ามไป
ในขั้นสุดท้าย คุณเป็นเจ้าของขั้นตอนการเรนเดอร์ วิดีโอที่สร้างจากโค้ดสามารถตรวจสอบได้ แยกความแตกต่างได้ รันซ้ำได้ที่ความละเอียดอื่น และมีต้นทุนต่ำในแบบเดียวกับที่ข้อความตอบกลับมีต้นทุนต่ำ — แค่ค่าโทเค็นไม่กี่ดอลลาร์ แทนที่จะเป็นการคิดค่าบริการรายวินาที คุณยังต้องรับผิดชอบทุกความล้มเหลวด้วย: ฟอนต์ที่หายไป งบเฟรมที่ไม่ดี หรือตัวเรนเดอร์ที่ไม่สอดคล้องกับโค้ดที่ได้รับมา
ตอนขาเข้า ไม่มีอะไรให้ยื่นให้มันดูได้เลย หากวัตถุดิบต้นทางของคุณเป็นไฟล์บันทึกหน้าจอ คลิปโปรดักต์ เว็บบินาร์ยาวสองชั่วโมง หรือหนังเปิดตัวของคู่แข่ง Claude Opus 5.5ก็ไม่สามารถดูมันได้ คุณทำได้เพียงส่งบทถอดเสียง สไลด์ในรูปแบบภาพนิ่ง หรือคำอธิบายที่คนอื่นเขียนไว้ นั่นคือข้อจำกัดที่กำหนดสถาปัตยกรรมได้จริง และมันมองไม่เห็นในเดโมรีล
สองค่าย: 60 โมเดลรับเอกสาร, 29 รับคลิป
จัดกลุ่มโมเดลทั้ง 182 ตัวตามชุดอินพุตที่แน่นอนของแต่ละโมเดล แล้วบอร์ดจะแยกออกเป็นสองกลุ่มที่แทบไม่ทับซ้อนกัน
ค่าย A — เอกสารและรูปภาพ ไม่มีวิดีโอ: 60 โมเดล ราคาอินพุตมัธยฐาน 2.00 ดอลลาร์ต่อล้านโทเค็น นี่คือจุดที่ Claude Opus 5.5 ตั้งอยู่ ควบคู่ไปกับโมเดล Anthropic ทั้งสิบเอ็ดโมเดล สามในห้าแถวของ Grok และปลายด้านการให้เหตุผลของแคตตาล็อก OpenAI — ทุกแถวของ GPT-4.1 และ GPT-6 และในตระกูล GPT-4o และ GPT-5 ทุกอย่างยกเว้นตัวแปร voice, codex, search และ chat-latest ค่าย A ยังครองเพดานสูงสุดของตารางราคาอีกด้วย: openai/gpt-5.5-pro และ openai/gpt-5.4-pro ที่ 30 ดอลลาร์ต่อล้านโทเค็นอินพุต นั่นคือราคาอินพุตที่สูงที่สุดในบอร์ดทั้งหมด และเป็นราคาที่พวกมันใช้ร่วมกับแถว GPT-4 ของ OpenAI สองแถวและปลายทางแปลงข้อความเป็นเสียงอีกสองแห่ง ซึ่งไม่มีอันใดอ่านเอกสารได้ ทั้งแปดไม่มีตัวใดดูวิดีโอได้เลย
แคมป์ B — ข้อความ รูปภาพ และวิดีโอ ไม่มีไฟล์: 29 โมเดล ราคาอินพุตมัธยฐาน 0.25 ดอลลาร์ต่อหนึ่งล้านโทเคน ยี่สิบสองจากยี่สิบเก้าโมเดลมีคำนำหน้า Qwen ส่วนที่เหลือคือ MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B และบิลด์ Qwen ที่ปรับแต่งสำหรับ Obsidian อีกสองตัว เพดานของมันคือ Qwen3.8-Max ที่ราคา 2.00 ดอลลาร์ต่อหนึ่งล้านโทเคน — กล่าวคือโมเดลอ่านวิดีโอที่แพงที่สุดในแคมป์นี้มีราคาเป็นครึ่งหนึ่งพอดีของ Claude Opus 5.5
ช่องว่างมัธยฐานระหว่างสองค่ายคือ 8× ส่วนช่องว่างด้านสมาชิกภาพยังชัดเจนกว่าเดิมอีก จาก 182 โมเดลที่ระบุพื้นผิวอินพุต 60 ตัวรับเอกสารแต่ไม่รับวิดีโอ 32 ตัวรับวิดีโอแต่ไม่รับเอกสาร 73 ตัวไม่รับทั้งสองอย่าง และมีเพียง 17 ตัวที่รับทั้งสองอย่าง ความทับซ้อนเล็กพอจนสองกลุ่มนี้ดูเหมือนเป็นผลิตภัณฑ์ที่แทบไม่ข้องเกี่ยวกันเลย และ 17 ตัวที่อยู่ตรงกลางก็เกือบทั้งหมดเป็นชั้นสูงของ Google — สิบห้าในสิบเจ็ด — บวกกับบิลด์ Muse Spark สองตัวของ Meta

มีเหตุผลที่เป็นไปได้สำหรับลักษณะนี้ การทำความเข้าใจเอกสารและการทำความเข้าใจวิดีโอเป็นปัญหาทางวิศวกรรมที่ต่างกัน และมีเส้นต้นทุนที่ต่างกัน ผู้ให้บริการที่แก้ปัญหาวิดีโอได้ก่อนส่วนใหญ่คือรายที่ขายโทเคนราคาถูกกันเป็นร้อยล้าน ส่วนผู้ให้บริการที่แก้ปัญหาเอกสารได้ก่อนคือรายที่ขายความสามารถในการให้เหตุผลในราคาพรีเมียม ยังไม่มีใครถูกบังคับให้ทำทั้งสองอย่างในราคาเดียวกัน ตลาดจึงแยกออกเป็นผลิตภัณฑ์สองแบบและตั้งราคาให้สอดคล้องกัน
สิบเก้าที่เอาทุกสิ่งไป
โมเดลสิบเก้าตัวรองรับอินพุตทั้งสี่ประเภท — ข้อความ รูปภาพ วิดีโอ และเสียง สิบหกตัวเป็นของ Google สองตัวเป็นของ Meta หนึ่งตัวเป็นของ MiniMax ช่วงของ Google เองในกลุ่มนั้นเริ่มตั้งแต่ $0.10 ต่อล้าน สำหรับ gemini-2.5-flash-lite ไปจนถึง $4.00 สำหรับ gemini-pro-latest ดังนั้น "อ่านได้ทุกอย่าง" ไม่ใช่ระดับราคา แต่เป็นการตัดสินใจที่ Google ทำในทุกระดับราคา สิ่งที่ Meta นำมาคือคู่ของบิลด์ Muse Spark — Muse Spark 1.1 และ Muse Spark 1.2 ซึ่งเหมือนกันในแค็ตตาล็อกที่ $1.25 ต่อล้านสำหรับอินพุต และ $4.25 สำหรับเอาต์พุต พร้อมบริบท 1M โทเคน
นี่คือกลุ่มที่ทำให้ประเด็นสำคัญของบทความชัดเจน: ไปป์ไลน์ที่รับรู้วิดีโอไม่จำเป็นต้องใช้เรือธง สิ่งที่ต้องใช้คือการเลือกจากรายการที่มีสิบเก้ารายการ ซึ่งสิบรายการมีค่าใช้จ่ายน้อยกว่าหนึ่งดอลลาร์ต่อหนึ่งล้านโทเคนอินพุต
โมเดลห้าตัวบนบอร์ดนี้ส่งออกสิ่งอื่นนอกเหนือจากข้อความ
การอ่านวิดีโอกับการสร้างวิดีโอเป็นคนละเทคนิค และอย่างหลังหายากกว่า ในบรรดาโมเดล 204 ตัว 139 ตัวระบุพื้นผิวเอาต์พุต; ห้าตัวในจำนวนนั้นระบุสิ่งอื่นที่ไม่ใช่ข้อความ
สามตัวเป็นเครื่องสร้างภาพ: Nano Banana (Gemini 2.5 Flash Image) ราคา $0.30 สำหรับอินพุต และ $30.00 สำหรับเอาต์พุต ต่อล้านโทเค็น Nano Banana Pro (Gemini 3 Pro Image Preview) ราคา $0.24 ต่อคำขอ และ Nano Banana 2 (Gemini 3.1 Flash Image Preview) ราคา $0.151 ต่อคำขอ สองตัวสร้างวิดีโอ: MiniMax H3 คิดค่าบริการตามวินาทีของเอาต์พุตที่สร้างขึ้น — $0.08 ต่อวินาทีที่ 768P และ $0.13 ที่ 2K สำหรับคลิปความยาวสี่ถึงสิบห้าวินาทีพร้อมเสียงสเตอริโอแบบเนทีฟ — และ OrcaDub 1.0 คิดค่าบริการ $0.60 ต่อนาทีของวิดีโอต้นฉบับ ครอบคลุม 28 ภาษา และโคลนเสียงแยกสำหรับผู้พูดแต่ละคน
มีกรอบแนวคิดสองแบบที่ควรหลีกเลี่ยงตรงนี้ ประการแรก แถวที่เหลืออีก 65 แถวปล่อยช่องเอาต์พุตไว้ว่างเปล่า ความว่างเปล่าหมายความว่าแคตตาล็อกไม่ได้บันทึกพื้นผิวเอาต์พุต และไม่ใช่หลักฐานว่าโมเดลส่งออกเฉพาะข้อความ ประการที่สอง การอ่านวิดีโอและการสร้างวิดีโอเป็นแกนที่แยกจากกันโดยแทบไม่ทับซ้อนกันบนบอร์ดนี้ — OrcaDub 1.0รับวิดีโอเข้าและคืนวิดีโอกลับออกมา ซึ่งทำให้มันเป็นโมเดลเดียวในที่นี้ที่อาจอยู่ทั้งสองปลายของไปป์ไลน์ได้อย่างสมเหตุสมผล ในขณะที่ MiniMax H3รับอินพุตสี่ประเภทเพื่อสร้างเอาต์พุตเพียงประเภทเดียวที่ไม่ใช่ข้อความ
กำหนดเส้นทางอะไรไปที่ไหน
สี่กฎที่ได้มาจากสำมะโนนี้ และนำไปใช้ได้โดยมีต้นทุนต่ำ
• หากอินพุตของคุณเป็นคลิป อย่าเพิ่งหยิบโมเดลเรือธงระดับแนวหน้ามาใช้ก่อน กลุ่มที่อ่านวิดีโอได้โดยไม่ต้องใช้เอกสารมีอยู่ 29 โมเดล โดย 22 โมเดลเป็น Qwen และค่ามัธยฐานอยู่ที่หนึ่งในสี่ต่อล้าน แทนที่จะเป็นเช่นนั้น จงส่งเฟรมและทรานสคริปต์ไปให้โมเดลเรือธง แล้วปล่อยให้มันเป็นคนคิดวิเคราะห์
• หากอินพุตของคุณเป็น PDF สัญญา หรือเอกสารยาว ค่ายวิดีโอเป็นค่ายที่ผิด มีเพียง 17 โมเดลที่ประกาศรองรับทั้งอินพุตไฟล์และวิดีโอ และทุกโมเดลที่ประกาศรองรับอินพุตไฟล์ก็ประกาศรองรับอินพุตรูปภาพด้วย ดังนั้นจึงมาคู่กัน Claude Opus 5.5 ในราคา $4.00 ต่อล้าน ให้ทั้งความสามารถด้านเอกสารและหน้าต่าง 1M โทเคน ซึ่งเป็นข้อแลกเปลี่ยนที่คุณกำลังทำอยู่
• หากคุณต้องการสร้างสื่อออกมา คุณกำลังเลือกจากห้าโมเดล ไม่ใช่จากบอร์ด สามโมเดลสร้างภาพนิ่ง และอีกสองโมเดลสร้างวิดีโอ โดยสองตัวหลังคิดค่าบริการเป็นรายวินาทีและรายนาทีแทนที่จะคิดต่อโทเค็น ดังนั้นการประเมินต้นทุนที่สร้างจากราคาอินพุตจึงผิดตั้งแต่แรกโดยธรรมชาติ
• ถ้าคุณต้องการเอาต์พุตวิดีโอและต้นทางของคุณเป็นสคริปต์ การสร้างโค้ดยังคงเป็นเส้นทางที่ถูกที่สุดบนบอร์ดนี้ Claude Opus 5.5 เขียนตัวเรนเดอร์ในราคาของข้อความ; MiniMax H3 เรนเดอร์มันในราคาแปดเซนต์ต่อวินาที การเชื่อมทั้งสองเข้าด้วยกันมีค่าใช้จ่ายน้อยกว่าทางเลือกใดทางหนึ่ง และเหลือไฟล์ที่คุณแก้ไขได้ไว้ให้คุณ
คำถามที่พบบ่อย
Claude Opus 5.5 ดูวิดีโอได้ไหม
ไม่ รูปแบบอินพุตที่ประกาศไว้คือข้อความ รูปภาพ และไฟล์ วิดีโอไม่ได้อยู่ในนั้น และเสียงก็ไม่ได้รวมอยู่ด้วย การบันทึกหน้าจอหรือคลิปผลิตภัณฑ์จะต้องถูกแปลง — เป็นเฟรมที่สุ่มมา, ข้อความถอดเสียง, หรือทั้งสองอย่าง — ก่อนที่จะสามารถส่งได้
Claude Opus 5.5 สร้างวิดีโอได้โดยตรงหรือไม่
ไม่ใช่ในฐานะมอดาลิตี มันคืนข้อความ และข้อความนั้นมักเป็นโปรแกรมที่สมบูรณ์ในตัวเองซึ่งเรนเดอร์การเคลื่อนไหวเมื่อคุณรันมัน การเรนเดอร์เป็นของคุณ โมเดลไม่เคยเปล่งพิกเซลเลย หากคุณต้องการโมเดลบนบอร์ดนี้ที่คืนวิดีโอเอง MiniMax H3 และ OrcaDub 1.0 คือสองตัวนี้
"multimodal" เป็นระดับราคาหรือเปล่า?
Google เปิดตัวโมเดลที่รองรับอินพุตครบทั้งสี่รูปแบบ ในราคาตั้งแต่ $0.10 ต่อล้านโทเคนอินพุต ไปจนถึง $4 ต่อล้าน และ openai/gpt-5.5-proที่ราคา $30 ต่อล้าน อ่านเอกสารและรูปภาพได้ แต่ไม่รองรับวิดีโอ สิ่งที่คุณจ่ายไปคือระดับการให้เหตุผล ไม่ใช่จำนวนโมดัลลิตี้
ทำไมโมเดลเพียงไม่กี่ตัวจึงอ่านเอกสารได้ ในเมื่อมีหลายตัวที่อ่านภาพได้
เนื่องจากไฟล์และรูปภาพไปด้วยกันบนบอร์ดนี้: โมเดลที่อ่านไฟล์ได้ทั้ง 77 ตัวก็อ่านรูปภาพได้ด้วย ดังนั้นอินพุตไฟล์จึงเป็นส่วนขยายของอินพุตรูปภาพ มากกว่าจะเป็นความสามารถอิสระ ตัวเลขที่ควรจำคือ ในบรรดา 182 โมเดลที่ระบุพื้นผิวอินพุต มี 60 ตัวที่รับเอกสารและรูปภาพ และไม่รับวิดีโอเลย — หนึ่งในสามของบอร์ด และเป็นจุดที่ระดับเรือธงตั้งอยู่
ควรตั้งราคาไปป์ไลน์วิดีโออย่างไรดี
ตามหน่วยที่โมเดลใช้คิดค่าบริการ โมเดลอ่านวิดีโอคิดราคาต่อโทเค็นเหมือนโมเดลแชตทั่วไป ส่วนโมเดลสร้างวิดีโอบนบอร์ดนี้คิดราคาต่อวินาทีของเอาต์พุต (MiniMax H3: $0.08 ที่ 768P, $0.13 ที่ 2K) หรือต่อนาทีของต้นฉบับ (OrcaDub 1.0: $0.60) การนำสองหน่วยนี้มาปนกันในการประเมินครั้งเดียวคือสาเหตุที่พบบ่อยที่สุดที่ทำให้งบประมาณวิดีโอออกมาไม่ถูกต้อง
บรรทัดที่ต้องจดจำ
สิ่งที่น่าสนใจเกี่ยวกับ Claude Opus 5.5 ไม่ใช่ว่ามันเป็นมัลติโมดัล เพราะโมเดลส่วนใหญ่บนบอร์ดก็เป็น สิ่งที่น่าสนใจคือเส้นแบ่งของมอดัลลิตีตกอยู่ในตำแหน่งที่ไม่ปกติ — เอกสารและภาพนิ่งเข้า ข้อความออก ไม่มีวิดีโอทั้งขาเข้าและขาออก — ในขณะที่เดโมที่ทำให้มันโด่งดังกลับเป็นวิดีโอ สองข้อเท็จจริงนี้ไม่ได้ขัดแย้งกัน และการอ่านว่ามันขัดแย้งกันนั่นแหละคือสิ่งที่ทำให้เรื่องราวโค้ด-วิดีโอดูสับสน โมเดลเขียนตัวเรนเดอร์ ตัวเรนเดอร์สร้างภาพยนตร์ สิ่งที่มอบให้โมเดลได้คือสคริปต์ เอกสาร และภาพหน้าจอ

ทุกอย่างข้างต้นเป็นสแนปช็อตของแค็ตตาล็อก OrcaRouter ณ วันที่ 2026-09-29 และการประกาศโมดัลลิตีที่อยู่ในนั้น สเปกของผู้ขายเปลี่ยนแปลงได้ และรายการโมดัลลิตีในโมเดลการ์ดคือสิ่งแรกที่ต้องตรวจสอบซ้ำก่อนที่คุณจะอ้างอิงตัวเลขใด ๆ หากคำกล่าวอ้างใดที่นี่สำคัญต่อการตัดสินใจ ให้เปิดหน้าโมเดล — ฟิลด์ต่าง ๆ อยู่บนหน้านั้น
