
Vidu Q4 Preview vs Seedance 2.5: Referensbudgeten är inte den verkliga skillnaden
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
De publicerade referensbudgetarna framstår som en klar seger för Seedance 2.5: upp till 30 bilder, 10 videoklipp och 10 ljudklipp mot Vidu Q4 Previews 15 bilder och 3 ljudklipp. Det är dubbelt så många bilder och tre gånger så mycket ljud, och i sig skulle det avgöra frågan. Det gör det inte, eftersom siffran som spelar roll inte är antalet – det är den andra modaliteten. Seedance 2.5 accepterar video som indatareferens. Vidu Q4 Preview accepterar bilder och ljud, och har ingen dokumenterad väg att ta in ett befintligt klipp.
Seedance 2.5 lanserades den 31 juli 2026 som ByteDances långformatsbidrag och genererar ett 30-sekundersklipp i en enda körning, med flertursförlängning för längre sekvenser. Vidu Q4 Preview lanserades den 7 oktober 2026 av Shengshu Technology som en förhandsvisning av sitt nästa generations flaggskepp, med två lägen – bild-till-video och referens-till-video – och två dokumenterade API-slutpunkter. Båda är referensintensiva modeller. De byggdes för att rymma olika saker.
Vad varje inmatningsmodalitet faktiskt låser upp
En modell som tar bilder som referenser kan hålla en rollbesättning och en look. Dokumentationen för Vidu Q4 Preview beskriver hur man kombinerar 1–15 bilder över karaktärer, scener och stil så att subjekten förblir konsekventa genom en tagning med flera skott, med upp till 3 mp3-ljudreferenser på 3–12 sekunder som klonar en röst och håller framförandet samstämmigt. Femton platser fördelade över en enda scens rollbesättning, garderob, rekvisita och ljussättning är en sammanhållen budget, och det är anledningen till att modellen delar förstaplatsen på preferenslistan för bild-till-video.
En modell som också tar video som referens kan riktas mot videomaterial. Att Seedance 2.5 accepterar upp till 10 videoindata tillsammans med 30 bilder och 10 ljudklipp innebär att referensuppsättningen kan omfatta rörelse, tempo och kamerabeteende hämtade från ett befintligt klipp i stället för att beskrivas i en prompt. Det är en annan förmåga, inte en större version av samma förmåga, och det är vad som placerar Seedance 2.5 på videoredigeringslistan hos Artificial Analysis — tvåa, med 1 161 Elo över 5 162 röster enligt avläsning den 8 oktober 2026 — för redigering av en video från en textinstruktion med ljudet bevarat. Vidu Q4 Preview finns inte på den listan, och anledningen är dess lista över ändpunkter, inte dess poäng.
Den praktiska kontrasten:
• Bildreferenser — Vidu Q4 Preview upp till 15 vs Seedance 2.5 upp till 30
• Videoreferenser — Vidu Q4 Preview inga dokumenterade vs Seedance 2.5 upp till 10
• Ljudreferenser — Vidu Q4 Preview upp till 3 mp3-klipp på 3–12 sekunder jämfört med Seedance 2.5 upp till 10
• Längd per enskild körning — Vidu Q4 Preview 3–16 sekunder på Image-to-Video, 1–16 sekunder på Reference-to-Video jämfört med Seedance 2.5 30 sekunder i en körning, med förlängning över flera omgångar därutöver
• Lägen — Vidu Q4 Preview Image-to-Video och Reference-to-Video mot Seedance 2.5 text-to-video, reference-to-video och video-in reference, med en redigeringsväg på agendan
• Upplösning för utdata — Vidu Q4 Preview 540p upp till 4K som prissatta genereringsnivåer, 2K och 4K i 10-bitars färg mot Seedance 2.5 480p och 720p på de värdar som publicerar dess inställningar, där högre nivåer når leveransupplösning via en uppskalning
Ställ dem sida vid sida, och modellerna konkurrerar inte om samma brief. En tagning i 4K på sexton sekunder med femton referenser och en tagning i 720p på trettio sekunder med trettio referenser och videoindata är svar på två olika produktionsfrågor.
Prisenheterna konverteras inte, och det är hela historien.
Det är här de flesta jämförelser mellan dessa två går fel, och felet ligger i enheten snarare än i aritmetiken.
Seedance 2.5 säljs inte per sekund av sin leverantör. ByteDance mäter modellen i videotokens enligt den officiella prislistan, som publiceras via Volcano Engine Ark i Kina och BytePlus ModelArk internationellt. Vad ett klipp kostar beror på upplösning, längd och faktisk tokenanvändning, så en siffra per sekund gäller bara för en upplösning och en längd — och misslyckade tagningar debiteras samma som lyckade. Tredjepartsvärdar som tillhandahåller Seedance 2.5 lägger på sin egen marginal och publicerar sin egen taxa per sekund eller per klipp, vilket är anledningen till att ett dussin sidor ger ett dussin olika siffror och ingen av dem är leverantörens.
Vidu Q3 går tvärtom: en fast kreditsats per sekund som bara varierar med den upplösningsnivå du väljer, öppet publicerad av Shengshu. Nio krediter per sekund vid 540p, 19 vid 720p, 24 vid 1080p, 38 vid 2K, 78 vid 4K, mot en angiven plattformskreditsats på $0,005, med tidsbegränsade paketrabatter på upp till 30 % som för närvarande gäller. Till listpris går kurvan från ungefär $0,045 per sekund vid 540p till omkring $0,39 vid 4K. Siffran på $0,014 per sekund från lanseringstillkännagivandet är 540p-nivån med rabatten inräknad.
Vilket innebär att de två prislistorna inte kan jämföras rad för rad, och varje sida som gör det jämför en leverantörs öppna lista med en värds påslag. Det som går att jämföra är vad leverantören publicerar om hur var och en är uppbyggd: Vidus kostnad skalar med upplösning och varaktighet och går att känna till innan du trycker på generera; Seedances mäts i tokens och beror därför på hur modellen väljer att spendera tokens på din prompt. Den ena är förutsägbar, den andra är mätarbaserad. Ingen av dem är fel, men de passar olika köpare – och den andra är den farligare av de två att budgetera mot, eftersom variansen ligger på leverantörens sida av linjen.
På den oberoende resultattavlan bör de registrerade siffrorna per minut bara läsas som en storleksordning. Artificial Analysis registrerar Vidu Q4 Preview till $7.20 per minut på bild-till-video-tavlan, och Dreamina Seedance 2.5 till $34.12 per minut för text-till-video och $40.82 för redigering. Dessa kolumner är kostnaden för en minut 1080p-utdata med varje modells standardinställningar — och Seedance 2.5 använder som standard den längre, tyngre konfiguration som dess prislista prissätter, medan Vidu Q4 Previews standard är ett klipp från en enda generering. De mäter olika standardbeteenden, inte en effektivitetsskillnad på fyra till fem gånger.
Sexton sekunder mot trettio är en verklig skillnad
Det finns en jämförelse som överlever enhetsproblemet, och det är längden. Trettio sekunder i en enda körning är nästan dubbelt så långt som Vidu Q4 Previews tak på sexton sekunder, och Seedance 2.5:s förlängning över flera turer innebär att en sekvens kan byggas förbi det. För narrativt arbete – en scen med en båge, en annons med en uppbyggnad och en poäng – är skillnaden mellan sexton och trettio sekunder skillnaden mellan en tagning och en scen.
I den fina änden slår det åt andra hållet. Vidu Q4 Preview genererar från tre sekunder, och dess 540p-nivå är prissatt till ungefär en tredjedel av dess egen 720p-taxa, vilket gör det billigt att blocka en komposition innan man satsar på en rendering i full upplösning. Inget i den publicerade prisstrukturen för Seedance 2.5 spelar den rollen: dess 480p-hostnivå kostar mindre än 720p, men leverantörens egen fakturering är tokenbaserad, så ett kort test i låg upplösning har inget tydligt publicerat pris att planera mot.
Vilken, i korthet?
Använd Seedance 2.5 när jobbet innefattar filmmaterial som du redan har. Om arbetet går ut på att förlänga, ge ny stil åt eller klippa om ett befintligt klipp, eller om referensuppsättningen behöver förmedla rörelse snarare än bara utseende, är videoindata den avgörande förmågan och Vidu Q4 Preview kan inte ersätta den. Lägg till den trettio sekunder långa enskilda körningen, och saken är enkel för narrativt och reklammässigt arbete med en längre båge.
Välj Vidu Q4 Preview när jobbet är en rollbesättning som måste hålla och en leveransspecifikation som går över 720p. Nativ 2K- och 4K-generering i 10-bitars färg är en nivå som Seedance 2.5 inte publicerar på leverantörsnivå, och priset per sekund gör en 4K-tagning till en kvantitet du faktiskt kan budgetera i stället för en okänd faktor som mäts löpande. Femton bildreferenser och tre röstreferenser räcker för en rollbesättning i en enda scen, och 540p-blockeringsnivån gör iteration billig.
Det som skulle ändra på detta: en fullständig Vidu Q4-lansering som lägger till en modalitet för videoinmatning skulle eliminera den strukturella skillnaden och göra dessa två till direkta konkurrenter, och Shengshus eget material säger att förhandsversionen finns just för att samla in den feedback som formar den slutliga versionen. Å andra sidan: om ByteDance publicerar en exempeltabell för token-taxor vid fler inställningar blir asymmetrin mellan mätbaserad och förutsägbar prissättning mycket lättare att planera kring. Tills något av detta blir verklighet är den korrekta tolkningen av ”30 referenser mot 15” att en av dessa modeller tar emot video och den andra inte.
En nyckel för videomodellerna du faktiskt kan anropa
OrcaRouter placerar video- och språkmodeller bakom en enda OpenAI-kompatibel slutpunkt på en nyckel, till leverantörens listpriser som förs vidare utan något påslag, så att en ändring av leverantörens pris slår igenom samma dag i stället för vid förnyelse. Vidu Q4 Preview och Seedance 2.5 är för närvarande inte OrcaRouter-rutter, och den här sidan antyder inte något annat. De videorutter vi faktiskt tillhandahåller – Kling 3.0 och dess Turbo- och v2.6-varianter bland dem – ligger bredvid språkmodellerna på samma slutpunkt och med samma förfrågningsformat, med automatisk failover mellan rutter i stället för ett separat avtal per modell.
Det är strukturen som gör en jämförelse som den här möjlig att slutföra: kör kandidaterna på din egen brief, med dina egna inställningar, och låt acceptansfrekvensen avgöra i stället för två prislistor i olika enheter.



