
Claude Opus 5.5 สร้างมิวสิกวิดีโอในครั้งเดียว: "Plan a Video" ให้ผลลัพธ์ออกมาอย่างไรจริง ๆ
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 496 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 183 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
โพสต์บน X เมื่อวันที่ 23 กันยายน 2026 ระบุว่า "Claude's Plan a video by opus 5.5 one shotted" พร้อมแนบการยกย่องถึง @jeffgwoah นั่นเป็นคำกล่าวอ้างเชิงเดโม ไม่ใช่คำกล่าวอ้างเรื่องการเปิดตัว — และมันไปตกอยู่ผิดฝั่งของสิ่งที่มักเป็นเรื่องสำคัญ Claude Opus 5.5ไม่ใช่โมเดลที่ยังไม่เปิดตัวซึ่งต้องตามสืบจากข่าวหลุด Anthropic เปิดตัวมันเมื่อวันที่ 22 กันยายน 2026 ในราคา 4 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน และ 20 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน มันมีอายุได้หนึ่งวัน เปิดให้ใช้ทั่วไปแล้ว และอยู่ในตารางราคาเรียบร้อย ดังนั้นคำถามที่น่าสนใจจึงไม่ใช่ว่า Opus 5.5 มีอยู่จริงหรือไม่ แต่คือโพสต์ "one-shotted a video" เหล่านี้กำลังแสดงอะไรกันแน่ เพราะวลีนี้มีความหมายแคบกว่าที่ฟังดู และความต่างตรงนี้เป็นตัวชี้ขาดว่าคุณจะนำอะไรจากมันไปใช้ได้บ้างหรือไม่
นี่คือเวอร์ชันสั้น และเป็นส่วนที่โพสต์ซ้ำส่วนใหญ่ละเว้นไป: ในเดโมที่ทนต่อการตรวจสอบได้ Claude Opus 5.5 ไม่ได้สร้างพิกเซลขึ้นมา มันเขียนโค้ดที่วาดพิกเซลต่างหาก ผลลัพธ์คือโปรแกรม ไม่ใช่ไฟล์วิดีโอ
สิ่งที่เดโมทั้งสองที่แพร่หลายอยู่ทำจริงๆ
ผลงานสาธารณะสองชิ้นรองรับข้อกล่าวอ้างประเภทนี้ และทั้งสองชิ้นสามารถตรวจสอบได้เพราะทั้งคู่เผยแพร่ซอร์สของตนเอง
อันแรกคือมิวสิกวิดีโอความยาว 156.6 วินาที สำหรับเพลงชื่อ "I'm Upping My P(doom)" ซึ่งเป็นรีโปชื่อ PDoomVideo ที่เผยแพร่บน GitHub เมื่อวันที่ 22 กันยายน 2026 — วันเดียวกับที่ Opus 5.5 เปิดตัว README ของมันระบุว่าวิดีโอนี้ "ใช้การสร้างสองรอบ ทั้งคู่ทำใน Claude Code" โดยรอบแรกให้เครดิตกับ Claude Opus 5.5 (Medium) และรอบที่สองกับ Claude Opus 5.5 ที่ระดับความพยายามเริ่มต้น นอกจากนี้ยังระบุว่า "ทุกอย่างในรีโปนี้ถูกสร้างขึ้นโดยโมเดล" และ "ไม่มีการระบุไอเดียฉากใด ๆ" — คำสั่งเดียวที่ให้ไว้คือให้ใช้ดีไซน์ตัวละครแบบหนึ่งโดยเฉพาะ และให้ภาพกับทรานซิชันที่น่าสนใจแก่เนื้อเพลงแต่ละท่อน
อันที่สองคือ repo เดโมสามเกมที่เผยแพร่เมื่อวันที่ 23 กันยายน 2026 ซึ่งใกล้เคียงกับการทดลองแบบควบคุมมากกว่าการโชว์เคส: เกม 3D บนเบราว์เซอร์ที่เล่นได้สามเกม แต่ละเกมใช้พรอมต์เพียงหนึ่งประโยค สร้างขึ้นในเซสชันเดียว โดยที่ repo ระบุว่าไม่มีการแก้ไขโค้ดโดยมนุษย์เลย จากนั้นจึงนำไปดีพลอย เกมเหล่านี้เป็น HTML ไฟล์เดียวที่ไม่มีแอสเซตภายนอก — โมเดล พื้นผิว แอนิเมชัน และเสียง ล้วนถูกสร้างขึ้นแบบโพรซีเจอรัลโดยโค้ด หนึ่งในสามเกมนั้นกำหนดให้โมเดลต้องค้นหาผังอย่างเป็นทางการของแผนที่เกม และสร้างเรขาคณิตขึ้นใหม่จากการค้นคว้านั้นก่อนที่จะเขียนอะไรลงไป
ไม่มี repo ใดเป็นการเผยแพร่ของผู้ขาย ทั้งคู่เป็นอาร์ติแฟกต์จากบุคคลที่สามที่รายงานด้วยตนเอง และคำกล่าวอ้างเรื่อง "zero human edits" โดยเฉพาะนั้นเป็นคำกล่าวอ้างเกี่ยวกับประวัติ git ไม่ใช่สิ่งที่บุคคลภายนอกได้ตรวจสอบ ให้ถือว่าคำอธิบายกระบวนการเป็นคำบอกเล่าของผู้เขียน และตัวอาร์ติแฟกต์เองเป็นหลักฐาน
สตอรีบอร์ดคือผลลัพธ์ที่แท้จริง
รายละเอียดที่ตัดสินว่า "one-shotted" เป็นคำอธิบายที่ยุติธรรมหรือไม่ คือไฟล์ใน repo แรกที่ชื่อ STORYBOARD.md มันไม่ใช่รายการช็อตของมนุษย์ มันเป็นเอกสารที่โมเดลเขียนให้ตัวเองหลังจากผ่านการสร้างครั้งแรก และมันเจาะจงอย่างแท้จริง: กฎที่ว่า "มีอะไรเกิดขึ้นบนหน้าจอ" ในทุกช็อต, คำสั่งให้เก็บข้อความออกจากเฟรม, รายชื่อตัวละครที่มีการออกแบบตายตัว, จานสีที่เคลื่อนจากครีมอุ่นผ่านม่วงอวกาศไปยังแดงเตือนภัยและกลับมา, กฎที่ว่าสีหน้าของตัวละครค่อย ๆ เปลี่ยนไปแทนที่จะเปลี่ยนทันที, และข้อกำหนดที่ว่าทุกการตัดต่อต้องมีเหตุจูงใจจากการกระทำ — การกัดจนมืด, การตก, การซูมผ่านดวงตา
เอกสารนั้นคือแผนที่ข้อความสัญญาณกำลังชี้ไป โมเดลสร้างบรีฟงานกำกับขึ้นมา แล้วรันเอเจนต์ย่อยกับมันแบบขนาน โดยหนึ่งตัวต่อหนึ่งบท แต่ละตัวเขียนไฟล์ JavaScript ที่วาดส่วนไทม์ไลน์ของตัวเอง
ไปป์ไลน์การเรนเดอร์นั้นธรรมดาและควรพูดให้ตรงไปตรงมา เพราะนี่คือจุดที่กรอบความคิดแบบ "AI สร้างวิดีโอ" พังทลายลง: เฟรมต่างๆ ถูกวาดลงในหน้าเว็บโดยใช้ p5.js และไลบรารีแปรงสีน้ำ สคริปต์ Node ขับเคลื่อนหน้านั้นใน headless Chrome และจับภาพหน้าจอทุกเฟรม ส่วน ffmpeg รวมเฟรมเหล่านั้นเข้ากับแทร็กเสียง ที่ 24 เฟรมต่อวินาทีตลอด 156.6 วินาที นั่นคิดเป็นประมาณ 3,760 เฟรมที่เรนเดอร์ทีละเฟรม
ดังนั้นประโยคที่แม่นยำไม่ใช่ “Claude Opus 5.5 สร้างวิดีโอ” แต่คือ “Claude Opus 5.5 เขียน แล้วจากนั้นกำกับ โปรแกรมที่เรนเดอร์วิดีโอ” ความแตกต่างนี้ไม่ใช่เรื่องพิถีพิถันเกินเหตุ — มันเป็นเหตุผลทั้งหมดที่เทคนิคนี้มีประโยชน์กับใครก็ตามที่ไม่ได้ทำมิวสิกวิดีโอ
ทำไมประโยค "two generations" จึงสำคัญกว่าประโยค "one-shot"
README เดียวกันนี้บั่นทอนพาดหัวของมันเอง วิดีโอใช้การสร้างถึงสองรอบ ไม่ใช่รอบเดียว รอบแรกให้ผลลัพธ์ที่ผู้เขียนนำไปผลักดันต่อ สตอรีบอร์ดและคู่มือแอนิเมชัน — เอกสารที่ทำให้รอบที่สองเชื่อมโยงกันอย่างเป็นระบบ — ถูกเขียนขึ้นหลังจากรอบแรกนั้น ไม่ใช่ก่อนหน้านั้น
นั่นคือรูปร่างที่แท้จริงของงานเจเนอเรชันระยะยาวจริงจังทุกงาน และมันคุ้มค่าที่จะพูด เพราะกรอบคิดแบบครั้งเดียวจบสร้างความคาดหวังที่ชิ้นงานไม่ได้ตอบสนอง พรอมต์คือข้อความเดียว แต่งานไม่ใช่การทำเพียงรอบเดียว สิ่งที่โมเดลทำคือประคองการสร้างขนาดใหญ่ที่มีหลายไฟล์และใช้เวลาหลายชั่วโมงไว้ด้วยกันได้ดีพอ จนรอบที่สองกลายเป็นการแก้ไขมากกว่าการเริ่มใหม่ — ซึ่งเป็นความสามารถที่มีจริงและไม่หวือหวาเท่ากับ "พรอมต์เดียว วิดีโอเดียว"
มีตัวเลขอิสระที่อธิบายเรื่องนีได้ดีกว่าตัวเดโม Artificial Analysis วัด Claude Opus 5.5 บน Intelligence Index ของตนได้ 58 ที่ความพยายามสูงสุด — เป็นคะแนนสูงสุดที่เคยบันทึกไว้ นำหน้าอยู่หลายจุดเมื่อเทียบกับโมเดลถัดไป — และรายงานว่าโมเดลนี้ใช้โทเค็นเอาต์พุตประมาณ 119,000 ต่อหนึ่งงานใน Index เทียบกับประมาณ 73,000 สำหรับ Claude Opus 5 และประมาณ 78,000 สำหรับ Claude Fable 5.1 โดยใช้โทเค็นเอาต์พุตราว 1.6 เท่า และอยู่ที่ต้นทุนต่องานใกล้เคียงกัน (~$5.98 เทียบกับ ~$5.86) แม้ราคาต่อโทเค็นจะต่ำกว่า 20% การสร้างแบบระยะยาวคือสิ่งที่โปรไฟล์โทเค็นนั้นดูเหมือนจากภายนอก: โมเดลกำลังใช้ budget กับตัวเอง


จุดที่อาร์ติแฟกต์ใช้งานไม่ได้อีกต่อไป
รูปแบบความล้มเหลวในงานลักษณะนี้สอดคล้องกัน และทั้งสองรีโปก็ชี้ไปที่รูปแบบเดียวกันจากคนละทิศทาง
• ผลลัพธ์ที่ได้คือโปรแกรม ไม่ใช่ไฟล์ ถ้าคุณต้องการ MP4 ที่จะส่งให้ใครสักคนได้ คุณก็ยังต้องใช้ Node เบราว์เซอร์ และ ffmpeg อยู่ดี โมเดลสร้างตัวเรนเดอร์ ไม่ใช่ผลการเรนเดอร์ นั่นคือ build dependency ที่คุณต้องแบกรับไปตลอด
• มันขยายตามจำนวนเฟรม ไม่ใช่ตามพรอมป์ต์ 3,760 เฟรมต้องรันสคริปต์ข้ามคืนบนฮาร์ดแวร์ของผู้เขียนเอง ไม่มีอะไรใน Opus 5.5 ที่เปลี่ยนต้นทุนของการวาดเฟรมที่ 2,000
• ความเป็นดีเทอร์มินิสติกเป็นข้อกำหนด ไม่ใช่ของแถม เฟรมต่าง ๆ ถูกเรนเดอร์แบบขนานและไม่เรียงลำดับ ดังนั้นทุกเฟรมต้องเป็นฟังก์ชันบริสุทธิ์ของไทม์สแตมป์ของตัวเอง — ไม่มีสถานะที่พกพาไป ไม่มีความสุ่มที่ไม่ได้ตั้งเมล็ด โมเดลที่ไม่ได้ซึมซับสิ่งนี้จะสร้างวิดีโอที่กะพริบ ทั้งสองรีโปจัดการเรื่องนี้ได้ ไม่มีอะไรในพรอมป์ต์บังคับมัน
• One-shot ไม่ได้หมายความว่าไม่มีการตรวจสอบ หลักฐานที่ชัดเจนที่สุดคืองานเกมของ repo ที่สอง: โมเดลต้องค้นคว้าเลย์เอาต์ของแมปที่มีอยู่ก่อนจะลงมือสร้าง ซึ่งนั่นคือการที่โมเดลตัดสินเองว่าคำตอบแรกของมันคงผิด
• ยังไม่มีใครตีราคาความล้มเหลวได้ ไม่มีรีโปไหนรายงานว่าต้องลองกี่ครั้ง เผาผลาญโทเคนไปเท่าไร หรือการสร้างรอบสองมีสัดส่วนเท่าใดที่ใช้แก้ของรอบแรก นั่นคือตัวเลขที่ทีมต้องการจริง ๆ ก่อนจะตัดสินใจลงมือ
สิ่งที่สิ่งนี้เปลี่ยนแปลงสำหรับคุณ และสิ่งที่มันไม่ได้เปลี่ยนแปลง
ถ้าคุณหวังว่าจะได้โมเดลสร้างวิดีโอ Claude Opus 5.5 ไม่ใช่โมเดลแบบนั้น และฟุตเทจเดโมมากแค่ไหนก็ไม่ได้ทำให้มันกลายเป็นแบบนั้น เนื้อหาการเปิดตัวของ Anthropic ไม่มีความสามารถด้านการสร้างวิดีโอ การประเมินที่เผยแพร่ของโมเดลนี้คือการเขียนโค้ดแบบเอเจนต์ การใช้คอมพิวเตอร์ และงานองค์ความรู้ สิ่งที่เดโมแสดงให้เห็นคือการสร้างโค้ดระยะยาวจากบรีฟเชิงสร้างสรรค์ ซึ่งเป็นความสามารถเดียวกับที่ปรากฏในการย้ายโค้ด 680,000 บรรทัด และการพอร์ต C-to-Rust ที่ Anthropic อ้างถึงในโพสต์เปิดตัวของตัวเอง เพียงแค่ถูกนำไปใช้กับสิ่งที่คุณรับชมได้
ถ้านั่นคือความสามารถที่คุณต้องการ คำถามเชิงปฏิบัติก็จะไม่ใช่ "โมเดลไหน" อีกต่อไป แต่กลายเป็น "ฉันจะรันอะไรแบบนี้โดยไม่ผูกเส้นทางโปรดักชันไว้กับมันได้อย่างไร" การสร้างงานในระยะยาวมีค่าใช้จ่ายสูง และโหมดความล้มเหลวของมันเงียบ — คุณจะได้โปรแกรมที่ดูสมเหตุสมผล ซึ่งเรนเดอร์ได้สี่นาทีแล้วก็พัง วิธีที่สมเหตุสมผลในการทดสอบคือส่งงานผ่านเอนด์พอยต์ที่คุณมีอยู่แล้ว แทนที่จะใช้สัญญาใหม่: Opus 5.5 อยู่บน OrcaRouter ในราคาตามรายการของ Anthropic โดยมีมาร์กอัป 0% ควบคู่ไปกับโมเดลอื่น ๆ ในตระกูลเดียวกัน ดังนั้นการรันสร้างงานข้ามคืนจึงสามารถใช้คีย์เดียวกันและกฎ failover เดียวกันกับทุกอย่างที่คุณเรียกใช้ หากการรันตายที่เฟรม 3,000 นั่นเป็นปัญหาการกำหนดเส้นทางมากกว่าการรื้อสถาปัตยกรรมใหม่

มีสองสิ่งที่ควรจับตาก่อนที่คุณจะวางแผนโดยอิงจากเรื่องนี้ Anthropic กล่าวว่า Sonnet 5.5 และ Haiku 5.5 จะตามมา "ในอีกไม่กี่สัปดาห์ข้างหน้า" ซึ่งจะเปลี่ยนการคำนวณสำหรับการเรนเดอร์ที่ยาวนาน — โมเดลที่ถูกกว่าซึ่งสามารถประคองบิลด์หลายไฟล์ให้อยู่ด้วยกันได้จะทำให้การรันข้ามคืนกลายเป็นเรื่องปกติมากกว่าที่จะน่าสังเกต และรูปแบบสตอรีบอร์ดเองก็สามารถนำไปใช้ได้ทั่วไป: ไม่มีสิ่งใดในเอกสารนั้นที่เจาะจงกับ Opus 5.5 และไม่มีอะไรหยุดโมเดลที่เล็กกว่าจากการเขียนสตอรีบอร์ดที่แย่กว่า
สำหรับตอนนี้ การอ่านอย่างตรงไปตรงมาของ “Claude's Plan a video by opus 5.5 one shotted” นั้นแคบกว่าที่ฟังดู และมีประโยชน์กว่าที่เห็น โมเดลเขียนรายการช็อต บรีฟซับเอเจนต์ของตัวเอง แล้วจากนั้นก็เขียนตัวเรนเดอร์ — และข้อเท็จจริงที่ว่าแผนแบบนั้นรอดจากการปะทะกับ 3,760 เฟรมได้ คือข้ออ้างที่คุ้มค่าแก่การทดสอบ ไม่ใช่ตัววิดีโอ
