
Vidu Q4 Preview กับ Seedance 2.5: งบอ้างอิงไม่ใช่ความแตกต่างที่แท้จริง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
งบประมาณอ้างอิงที่เผยแพร่ดูเหมือนจะเป็นชัยชนะแบบขาดลอยสำหรับ Seedance 2.5: รูปภาพสูงสุด 30 รูป วิดีโอ 10 คลิป และคลิปเสียง 10 คลิป เทียบกับ Vidu Q4 Preview ที่มี 15 รูปภาพและ 3 คลิปเสียง นั่นคือรูปภาพมากเป็นสองเท่าและเสียงมากเป็นสามเท่า และหากพิจารณาเพียงเท่านี้ก็คงตอบคำถามได้ แต่ก็ไม่ใช่ เพราะตัวเลขที่สำคัญไม่ใช่จำนวน — หากแต่เป็นโมดัลลิตีที่สอง Seedance 2.5 ยอมรับวิดีโอเป็นข้อมูลอ้างอิงนำเข้า ส่วน Vidu Q4 Preview ยอมรับรูปภาพและเสียง และไม่มีเส้นทางที่ระบุไว้สำหรับการนำคลิปที่มีอยู่เข้ามา
Seedance 2.5 เปิดตัวเมื่อวันที่ 31 กรกฎาคม 2026 ในฐานะโมเดลแนว{long-form}ของ ByteDance โดยสร้างคลิปความยาว 30 วินาทีได้ในครั้งเดียว พร้อมการต่อขยายแบบหลายรอบ (multi-turn) สำหรับลำดับที่ยาวขึ้น Vidu Q4 Preview เปิดตัวเมื่อวันที่ 7 ตุลาคม 2026 จาก Shengshu Technology ในฐานะพรีวิวของเรือธงรุ่นถัดไป โดยมีสองโหมด — Image-to-Video และ Reference-to-Video — และ API endpoint ที่มีเอกสารระบุไว้สองรายการ ทั้งสองเป็นโมเดลที่เน้นการอ้างอิงอย่างมาก ทั้งคู่ถูกสร้างขึ้นมาเพื่อรองรับสิ่งที่แตกต่างกัน
แต่ละอินพุตปลดล็อกอะไรได้จริง
โมเดลที่ใช้ภาพเป็นข้อมูลอ้างอิงสามารถรักษาชุดตัวละครและรูปลักษณ์ไว้ได้ เอกสารของ Vidu Q4 Preview อธิบายการรวมภาพ 1–15 ภาพจากตัวละคร ฉาก และสไตล์ เพื่อให้ตัวแบบคงความสม่ำเสมอตลอดการถ่ายหลายช็อต โดยมีไฟล์เสียงอ้างอิง mp3 ได้สูงสุด 3 ไฟล์ ความยาว 3–12 วินาที สำหรับโคลนเสียงและรักษาจังหวะการพูดให้สอดคล้องกัน สล็อต 15 ช่องสำหรับนักแสดง เครื่องแต่งกาย พร็อพ และแสงในฉากเดียวถือเป็นงบที่ลงตัว และนี่คือเหตุผลที่โมเดลนี้ครองตำแหน่งร่วมอันดับต้น ๆ ของกระดานความชอบด้าน image-to-video
โมเดลที่รับวิดีโอเป็นข้อมูลอ้างอิงได้ด้วยสามารถชี้ไปที่ฟุตเทจได้ การที่ Seedance 2.5 ยอมรับอินพุตวิดีโอได้สูงสุด 10 รายการพร้อมกับรูปภาพ 30 รูปและคลิปเสียง 10 คลิป หมายความว่าชุดข้อมูลอ้างอิงสามารถรวมการเคลื่อนไหว จังหวะ และพฤติกรรมของกล้องที่ดึงมาจากคลิปที่มีอยู่แล้ว แทนที่จะอธิบายในพรอมป์ต์ นั่นเป็นความสามารถที่แตกต่างออกไป ไม่ใช่เวอร์ชันที่ใหญ่ขึ้นของความสามารถเดิม และนั่นคือสิ่งที่ทำให้ Seedance 2.5 อยู่บนกระดานจัดอันดับการตัดต่อวิดีโอที่ Artificial Analysis — เป็นอันดับสอง ด้วยคะแนน 1,161 Elo จาก 5,162 โหวต ณ วันที่ 8 ตุลาคม 2026 — การตัดต่อวิดีโอจากคำสั่งข้อความโดยคงเสียงไว้ Vidu Q4 Preview ไม่ได้อยู่บนกระดานนั้น และเหตุผลคือรายการเอนด์พอยต์ของมัน ไม่ใช่คะแนน
ความแตกต่างในทางปฏิบัติ:
• ภาพอ้างอิง — Vidu Q4 Preview สูงสุด 15 เทียบกับ Seedance 2.5 สูงสุด 30
• การอ้างอิงวิดีโอ — Vidu Q4 Preview ไม่มีการบันทึกไว้ เทียบกับ Seedance 2.5 สูงสุด 10
• อ้างอิงเสียง — Vidu Q4 Preview รองรับสูงสุด 3 คลิป mp3 ความยาว 3–12 วินาที เทียบกับ Seedance 2.5 สูงสุด 10
• ความยาวต่อการรันหนึ่งครั้ง — Vidu Q4 Preview 3–16 วินาทีสำหรับ Image-to-Video, 1–16 วินาทีสำหรับ Reference-to-Video เทียบกับ Seedance 2.5 ที่ 30 วินาทีในการรันครั้งเดียว พร้อมการขยายแบบหลายรอบให้ยาวเกินกว่านั้นได้
• โหมด — Vidu Q4 Preview Image-to-Video และ Reference-to-Video เทียบกับ Seedance 2.5 text-to-video, reference-to-video และ video-in reference โดยมีเส้นทางการตัดต่อบนบอร์ด
• ความละเอียดเอาต์พุต — Vidu Q4 Preview ตั้งแต่ 540p ถึง 4K ในรูปแบบระดับการสร้างที่คิดราคา โดย 2K และ 4K ที่สี 10-bit เทียบกับ Seedance 2.5 ที่ 480p และ 720p บนโฮสต์ที่เผยแพร่การตั้งค่าของมัน โดยระดับที่สูงกว่าจะไปถึงความละเอียดสำหรับการส่งมอบผ่านการอัปสเกล
ลองเอามาวางเทียบกันดู แล้วจะเห็นว่าโมเดลเหล่านี้ไม่ได้แข่งขันกันในโจทย์เดียวกัน การสร้างคลิป 4K ความยาว 16 วินาทีที่ใช้อ้างอิง 15 ภาพ กับคลิป 720p ความยาว 30 วินาทีที่ใช้อ้างอิง 30 ภาพพร้อมอินพุตวิดีโอ เป็นคำตอบของโจทย์การผลิตที่แตกต่างกันสองข้อ
หน่วยการกำหนดราคาไม่แปลงค่า และนั่นคือเรื่องทั้งหมด
นี่คือจุดที่การเปรียบเทียบสองสิ่งนี้ส่วนใหญ่ผิดพลาด และข้อผิดพลาดอยู่ที่หน่วย ไม่ใช่ที่การคำนวณ
Seedance 2.5 ไม่ได้ถูกผู้ให้บริการต้นทางขายเป็นรายวินาที ByteDance คิดค่าบริการโมเดลเป็นโทเคนวิดีโอตามตารางอัตราค่าบริการอย่างเป็นทางการ ซึ่งเผยแพร่ผ่าน Volcano Engine Ark ในจีน และ BytePlus ModelArk ในระดับสากล ค่าใช้จ่ายของคลิปหนึ่งคลิปขึ้นอยู่กับความละเอียด ระยะเวลา และปริมาณโทเคนที่ใช้จริง ดังนั้นตัวเลขต่อวินาทีจึงใช้ได้กับความละเอียดเดียวและระยะเวลาเดียวเท่านั้น — และเทคที่ล้มเหลวก็ถูกคิดค่าบริการเท่ากับเทคที่สำเร็จ โฮสต์บุคคลที่สามที่เปิดให้ใช้ Seedance 2.5 จะบวกกำไรของตัวเองเข้าไปด้านบน และเผยแพร่อัตราค่าบริการต่อวินาทีหรือต่อคลิปของตัวเอง นั่นจึงเป็นเหตุผลที่หน้าจำนวนหนึ่งโหลให้ตัวเลขที่แตกต่างกันหนึ่งโหล และไม่มีสักตัวเลยที่เป็นของผู้ให้บริการต้นทาง
Vidu Q4 Preview คิดราคาในทางกลับกัน: อัตราเครดิตต่อวินาทีแบบคงที่ซึ่งแปรผันตามเฉพาะระดับความละเอียดที่คุณเลือกเท่านั้น และเปิดเผยต่อสาธารณะโดย Shengshu โดยอยู่ที่ 9 เครดิตต่อวินาทีที่ 540p, 19 ที่ 720p, 24 ที่ 1080p, 38 ที่ 2K, 78 ที่ 4K เมื่อเทียบกับอัตราเครดิตแพลตฟอร์มที่ระบุไว้ที่ $0.005 พร้อมส่วนลดแบบแพ็กเกจจำกัดเวลาสูงสุด 30% ที่กำลังมีอยู่ในขณะนี้ ที่ราคาตามรายการ ช่วงอัตราจะอยู่ที่ประมาณ $0.045 ต่อวินาทีที่ 540p ไปจนถึงประมาณ $0.39 ที่ 4K ตัวเลข $0.014 ต่อวินาทีจากประกาศเปิดตัวคือระดับ 540p ที่ใช้ส่วนลดแล้ว
ซึ่งหมายความว่าอัตราค่าบริการทั้งสองรายการไม่สามารถนำมาเปรียบเทียบกันทีละบรรทัดได้ และหน้าใดก็ตามที่ทำเช่นนั้นก็กำลังเปรียบเทียบรายการเปิดเผยราคาของผู้ให้บริการรายหนึ่งกับส่วนบวกเพิ่มของเจ้าของแพลตฟอร์ม สิ่งที่เปรียบเทียบได้คือสิ่งที่ผู้ให้บริการเผยแพร่เกี่ยวกับโครงสร้างของแต่ละรายการ: ค่าใช้จ่ายของ Vidu ปรับเปลี่ยนตามความละเอียดและระยะเวลา และสามารถทราบได้ก่อนที่คุณจะกดปุ่มสร้าง ส่วนของ Seedance คิดค่าบริการตามโทเค็น ดังนั้นจึงขึ้นอยู่กับว่าโมเดลเลือกใช้โทเค็นกับพรอมป์ของคุณอย่างไร ตัวหนึ่งคาดการณ์ได้ อีกตัวคิดตามปริมาณการใช้งาน ไม่มีตัวใดผิด แต่เหมาะกับผู้ซื้อที่แตกต่างกัน — และตัวที่สองเป็นตัวที่เสี่ยงกว่าสำหรับการตั้งงบประมาณ เพราะความแปรปรวนอยู่ฝั่งของผู้ให้บริการ
บนบอร์ดอิสระ ตัวเลขต่อนาทีที่บันทึกไว้ควรอ่านเป็นเพียงลำดับขนาดเท่านั้น Artificial Analysis บันทึก Vidu Q4 Preview ไว้ที่ $7.20 ต่อนาทีบนบอร์ด image-to-video และ Dreamina Seedance 2.5 ที่ $34.12 ต่อนาทีบน text-to-video และ $40.82 ในการตัดต่อ คอลัมน์เหล่านั้นคือค่าใช้จ่ายของเอาต์พุต 1080p หนึ่งนาทีที่การตั้งค่าเริ่มต้นของแต่ละโมเดล — และค่าเริ่มต้นของ Seedance 2.5 คือคอนฟิกูเรชันที่ยาวกว่าและหนักกว่าซึ่งเรตการ์ดของมันกำหนดราคาไว้ ขณะที่ค่าเริ่มต้นของ Vidu Q4 Preview คือคลิปที่สร้างครั้งเดียว สิ่งเหล่านี้วัดพฤติกรรมเริ่มต้นที่แตกต่างกัน ไม่ใช่ช่องว่างด้านประสิทธิภาพสี่ถึงห้าเท่า
สิบห้าวินาทีเทียบกับสามสิบนั้นต่างกันจริง ๆ
มีการเปรียบเทียบหนึ่งอย่างที่ยังคงรอดจากปัญหาหน่วยวัดได้ และนั่นคือความยาว สามสิบวินาทีในการรันครั้งเดียวเกือบจะเป็นสองเท่าของเพดานสิบหกวินาทีของ Vidu Q4 Preview และการขยายแบบหลายเทิร์นของ Seedance 2.5 หมายความว่าลำดับสามารถสร้างให้ยาวเกินกว่านั้นได้ สำหรับงานเล่าเรื่อง — ฉากที่มีเส้นเรื่อง โฆษณาที่มีการปูเรื่องและการจบที่คุ้มค่า — ความแตกต่างระหว่างสิบหกกับสามสิบวินาทีคือความแตกต่างระหว่างช็อตกับฉาก
ในส่วนปลายความละเอียดต่ำกลับให้ผลตรงกันข้าม Vidu Q4 Preview สร้างได้ตั้งแต่ 3 วินาที และระดับ 540p ของมันมีราคาประมาณหนึ่งในสามของอัตรา 720p ของตัวเอง ซึ่งทำให้การวางองค์ประกอบมีต้นทุนต่ำก่อนที่จะลงมือเรนเดอร์ที่ความละเอียดเต็ม ไม่มีส่วนใดในโครงสร้างราคาที่ประกาศของ Seedance 2.5 ที่ทำหน้าที่นั้น: ระดับโฮสต์ 480p ของมันมีราคาถูกกว่าระดับ 720p แต่การคิดค่าบริการของผู้ขายเองนั้นคิดตามโทเคน ดังนั้นการทดสอบระยะสั้นความละเอียดต่ำจึงไม่มีราคาที่ประกาศไว้อย่างชัดเจนให้ใช้วางแผน
อันไหน ตามบรีฟ
ใช้ Seedance 2.5 เมื่องานเกี่ยวข้องกับฟุตเทจที่คุณมีอยู่แล้ว หากงานคือการขยายความยาว ปรับสไตล์ใหม่ หรือตัดต่อคลิปที่มีอยู่ใหม่ หรือหากชุดอ้างอิงจำเป็นต้องถ่ายทอดการเคลื่อนไหว ไม่ใช่เพียงรูปลักษณ์ อินพุตวิดีโอคือความสามารถที่ชี้ขาด และไม่สามารถใช้ Vidu Q4 Preview แทนได้ เพิ่มการรันครั้งเดียว 30 วินาทีเข้าไป แล้วข้อสรุปก็ตรงไปตรงมาสำหรับงานเล่าเรื่องและงานโฆษณาที่มีโครงเรื่องยาวขึ้น
เลือก Vidu Q4 Preview เมื่องานเป็นแคสต์ที่ต้องคงความสม่ำเสมอ และสเปกการส่งมอบที่เกิน 720p การสร้าง 2K และ 4K แบบเนทีฟที่สี 10-bit เป็นระดับที่ Seedance 2.5 ไม่ประกาศในระดับผู้ขาย และราคาต่อวินาทีทำให้เทค 4K เป็นปริมาณที่คุณตั้งงบได้จริง ไม่ใช่ตัวเลขที่ไม่รู้จักซึ่งคิดตามมิเตอร์ ภาพอ้างอิง 15 ภาพและเสียงอ้างอิง 3 เสียงเพียงพอสำหรับแคสต์ฉากเดียว และระดับบล็อกกิ้ง 540p ทำให้การทำซ้ำมีต้นทุนต่ำ
อะไรจะเปลี่ยนสิ่งนี้: การเปิดตัว Vidu Q4 ฉบับเต็มที่เพิ่มรูปแบบการป้อนข้อมูลวิดีโอจะทำให้ความแตกต่างเชิงโครงสร้างยุบหายไป และทำให้สองตัวนี้กลายเป็นคู่แข่งโดยตรง และเอกสารของ Shengshu เองระบุว่าเวอร์ชันพรีวิวมีขึ้นก็เพื่อรวบรวมฟีดแบ็กที่กำหนดรูปร่างของเวอร์ชันสุดท้ายนั่นเอง ในทางกลับกัน หาก ByteDance เผยแพร่ตารางตัวอย่างอัตราโทเค็นที่การตั้งค่าเพิ่มเติม ความไม่สมมาตรระหว่างการคิดตามการใช้งานจริงกับแบบที่คาดเดาได้จะวางแผนรับมือได้ง่ายขึ้นมาก จนกว่าอย่างใดอย่างหนึ่งจะเกิดขึ้นจริง การตีความที่ถูกต้องของ "30 เรฟเฟอเรนซ์เทียบกับ 15" คือ หนึ่งในโมเดลเหล่านี้รับวิดีโอเป็นอินพุต ส่วนอีกโมเดลไม่รับ
คีย์เดียวสำหรับโมเดลวิดีโอที่คุณเรียกใช้ได้จริง
OrcaRouter รวมโมเดลวิดีโอและโมเดลภาษาไว้เบื้องหลังเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI ด้วยคีย์เดียว ในราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยไม่บวกเพิ่มใด ๆ ดังนั้นเมื่อผู้ให้บริการปรับอัตราค่าบริการ การเปลี่ยนแปลงจะมีผลในวันเดียวกัน แทนที่จะเป็นตอนต่อสัญญา Vidu Q4 Preview และ Seedance 2.5 ไม่ใช่เส้นทางของ OrcaRouter ในปัจจุบัน และหน้านี้ไม่ได้สื่อเป็นอย่างอื่น เส้นทางวิดีโอที่เราให้บริการจริง — Kling 3.0 รวมถึงตัวแปร Turbo และ v2.6 ของมันด้วย — อยู่เคียงข้างโมเดลภาษาบนเอนด์พอยต์เดียวกันและรูปแบบคำขอเดียวกัน โดยมีการสลับไปยังเส้นทางสำรองอัตโนมัติระหว่างเส้นทาง แทนที่จะเป็นสัญญาแยกสำหรับแต่ละโมเดล
นั่นคือโครงสร้างที่ทำให้การเปรียบเทียบแบบนี้สำเร็จได้: ลองใช้แคนดิเดตกับบรีฟของคุณเอง ด้วยการตั้งค่าของคุณเอง แล้วให้อัตราการยอมรับเป็นตัวตัดสิน แทนที่จะเป็นการ์ดราคาสองใบในหน่วยที่ต่างกัน



