Ett genererat titelkort med texten ”Vidu Q4 Preview vs Seedance 2.5” och underrubriken ”Femton referenser mot trettio, plus en videoinmatning” samt två kort, det vänstra med texten ”Vidu Q4 Preview: 15 bilder, 3 ljudklipp, 16 sekunder, upp till 4K” och det högra med texten ”Seedance 2.5: 30 bilder, 10 videor, 10 ljudklipp, 30 sekunder per körning”. OrcaRouter-logotypen är sammansatt i det nedre högra hörnet.
Guides & Insights

Vidu Q4 Preview vs Seedance 2.5: Referensbudgeten är inte den verkliga skillnaden

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

De publicerade referensbudgetarna framstår som en klar seger för Seedance 2.5: upp till 30 bilder, 10 videoklipp och 10 ljudklipp mot Vidu Q4 Previews 15 bilder och 3 ljudklipp. Det är dubbelt så många bilder och tre gånger så mycket ljud, och i sig skulle det avgöra frågan. Det gör det inte, eftersom siffran som spelar roll inte är antalet – det är den andra modaliteten. Seedance 2.5 accepterar video som indatareferens. Vidu Q4 Preview accepterar bilder och ljud, och har ingen dokumenterad väg att ta in ett befintligt klipp.

Seedance 2.5 lanserades den 31 juli 2026 som ByteDances långformatsbidrag och genererar ett 30-sekundersklipp i en enda körning, med flertursförlängning för längre sekvenser. Vidu Q4 Preview lanserades den 7 oktober 2026 av Shengshu Technology som en förhandsvisning av sitt nästa generations flaggskepp, med två lägen – bild-till-video och referens-till-video – och två dokumenterade API-slutpunkter. Båda är referensintensiva modeller. De byggdes för att rymma olika saker.

Vad varje inmatningsmodalitet faktiskt låser upp

En modell som tar bilder som referenser kan hålla en rollbesättning och en look. Dokumentationen för Vidu Q4 Preview beskriver hur man kombinerar 1–15 bilder över karaktärer, scener och stil så att subjekten förblir konsekventa genom en tagning med flera skott, med upp till 3 mp3-ljudreferenser på 3–12 sekunder som klonar en röst och håller framförandet samstämmigt. Femton platser fördelade över en enda scens rollbesättning, garderob, rekvisita och ljussättning är en sammanhållen budget, och det är anledningen till att modellen delar förstaplatsen på preferenslistan för bild-till-video.

En modell som också tar video som referens kan riktas mot videomaterial. Att Seedance 2.5 accepterar upp till 10 videoindata tillsammans med 30 bilder och 10 ljudklipp innebär att referensuppsättningen kan omfatta rörelse, tempo och kamerabeteende hämtade från ett befintligt klipp i stället för att beskrivas i en prompt. Det är en annan förmåga, inte en större version av samma förmåga, och det är vad som placerar Seedance 2.5 på videoredigeringslistan hos Artificial Analysis — tvåa, med 1 161 Elo över 5 162 röster enligt avläsning den 8 oktober 2026 — för redigering av en video från en textinstruktion med ljudet bevarat. Vidu Q4 Preview finns inte på den listan, och anledningen är dess lista över ändpunkter, inte dess poäng.

Den praktiska kontrasten:

• Bildreferenser — Vidu Q4 Preview upp till 15 vs Seedance 2.5 upp till 30

• Videoreferenser — Vidu Q4 Preview inga dokumenterade vs Seedance 2.5 upp till 10

• Ljudreferenser — Vidu Q4 Preview upp till 3 mp3-klipp på 3–12 sekunder jämfört med Seedance 2.5 upp till 10

• Längd per enskild körning — Vidu Q4 Preview 3–16 sekunder på Image-to-Video, 1–16 sekunder på Reference-to-Video jämfört med Seedance 2.5 30 sekunder i en körning, med förlängning över flera omgångar därutöver

• Lägen — Vidu Q4 Preview Image-to-Video och Reference-to-Video mot Seedance 2.5 text-to-video, reference-to-video och video-in reference, med en redigeringsväg på agendan

• Upplösning för utdata — Vidu Q4 Preview 540p upp till 4K som prissatta genereringsnivåer, 2K och 4K i 10-bitars färg mot Seedance 2.5 480p och 720p på de värdar som publicerar dess inställningar, där högre nivåer når leveransupplösning via en uppskalning

Ställ dem sida vid sida, och modellerna konkurrerar inte om samma brief. En tagning i 4K på sexton sekunder med femton referenser och en tagning i 720p på trettio sekunder med trettio referenser och videoindata är svar på två olika produktionsfrågor.

Prisenheterna konverteras inte, och det är hela historien.

Det är här de flesta jämförelser mellan dessa två går fel, och felet ligger i enheten snarare än i aritmetiken.

Seedance 2.5 säljs inte per sekund av sin leverantör. ByteDance mäter modellen i videotokens enligt den officiella prislistan, som publiceras via Volcano Engine Ark i Kina och BytePlus ModelArk internationellt. Vad ett klipp kostar beror på upplösning, längd och faktisk tokenanvändning, så en siffra per sekund gäller bara för en upplösning och en längd — och misslyckade tagningar debiteras samma som lyckade. Tredjepartsvärdar som tillhandahåller Seedance 2.5 lägger på sin egen marginal och publicerar sin egen taxa per sekund eller per klipp, vilket är anledningen till att ett dussin sidor ger ett dussin olika siffror och ingen av dem är leverantörens.

Vidu Q3 går tvärtom: en fast kreditsats per sekund som bara varierar med den upplösningsnivå du väljer, öppet publicerad av Shengshu. Nio krediter per sekund vid 540p, 19 vid 720p, 24 vid 1080p, 38 vid 2K, 78 vid 4K, mot en angiven plattformskreditsats på $0,005, med tidsbegränsade paketrabatter på upp till 30 % som för närvarande gäller. Till listpris går kurvan från ungefär $0,045 per sekund vid 540p till omkring $0,39 vid 4K. Siffran på $0,014 per sekund från lanseringstillkännagivandet är 540p-nivån med rabatten inräknad.

Vilket innebär att de två prislistorna inte kan jämföras rad för rad, och varje sida som gör det jämför en leverantörs öppna lista med en värds påslag. Det som går att jämföra är vad leverantören publicerar om hur var och en är uppbyggd: Vidus kostnad skalar med upplösning och varaktighet och går att känna till innan du trycker på generera; Seedances mäts i tokens och beror därför på hur modellen väljer att spendera tokens på din prompt. Den ena är förutsägbar, den andra är mätarbaserad. Ingen av dem är fel, men de passar olika köpare – och den andra är den farligare av de två att budgetera mot, eftersom variansen ligger på leverantörens sida av linjen.

På den oberoende resultattavlan bör de registrerade siffrorna per minut bara läsas som en storleksordning. Artificial Analysis registrerar Vidu Q4 Preview till $7.20 per minut på bild-till-video-tavlan, och Dreamina Seedance 2.5 till $34.12 per minut för text-till-video och $40.82 för redigering. Dessa kolumner är kostnaden för en minut 1080p-utdata med varje modells standardinställningar — och Seedance 2.5 använder som standard den längre, tyngre konfiguration som dess prislista prissätter, medan Vidu Q4 Previews standard är ett klipp från en enda generering. De mäter olika standardbeteenden, inte en effektivitetsskillnad på fyra till fem gånger.

Sexton sekunder mot trettio är en verklig skillnad

Det finns en jämförelse som överlever enhetsproblemet, och det är längden. Trettio sekunder i en enda körning är nästan dubbelt så långt som Vidu Q4 Previews tak på sexton sekunder, och Seedance 2.5:s förlängning över flera turer innebär att en sekvens kan byggas förbi det. För narrativt arbete – en scen med en båge, en annons med en uppbyggnad och en poäng – är skillnaden mellan sexton och trettio sekunder skillnaden mellan en tagning och en scen.

I den fina änden slår det åt andra hållet. Vidu Q4 Preview genererar från tre sekunder, och dess 540p-nivå är prissatt till ungefär en tredjedel av dess egen 720p-taxa, vilket gör det billigt att blocka en komposition innan man satsar på en rendering i full upplösning. Inget i den publicerade prisstrukturen för Seedance 2.5 spelar den rollen: dess 480p-hostnivå kostar mindre än 720p, men leverantörens egen fakturering är tokenbaserad, så ett kort test i låg upplösning har inget tydligt publicerat pris att planera mot.

Vilken, i korthet?

Använd Seedance 2.5 när jobbet innefattar filmmaterial som du redan har. Om arbetet går ut på att förlänga, ge ny stil åt eller klippa om ett befintligt klipp, eller om referensuppsättningen behöver förmedla rörelse snarare än bara utseende, är videoindata den avgörande förmågan och Vidu Q4 Preview kan inte ersätta den. Lägg till den trettio sekunder långa enskilda körningen, och saken är enkel för narrativt och reklammässigt arbete med en längre båge.

Välj Vidu Q4 Preview när jobbet är en rollbesättning som måste hålla och en leveransspecifikation som går över 720p. Nativ 2K- och 4K-generering i 10-bitars färg är en nivå som Seedance 2.5 inte publicerar på leverantörsnivå, och priset per sekund gör en 4K-tagning till en kvantitet du faktiskt kan budgetera i stället för en okänd faktor som mäts löpande. Femton bildreferenser och tre röstreferenser räcker för en rollbesättning i en enda scen, och 540p-blockeringsnivån gör iteration billig.

Det som skulle ändra på detta: en fullständig Vidu Q4-lansering som lägger till en modalitet för videoinmatning skulle eliminera den strukturella skillnaden och göra dessa två till direkta konkurrenter, och Shengshus eget material säger att förhandsversionen finns just för att samla in den feedback som formar den slutliga versionen. Å andra sidan: om ByteDance publicerar en exempeltabell för token-taxor vid fler inställningar blir asymmetrin mellan mätbaserad och förutsägbar prissättning mycket lättare att planera kring. Tills något av detta blir verklighet är den korrekta tolkningen av ”30 referenser mot 15” att en av dessa modeller tar emot video och den andra inte.

En nyckel för videomodellerna du faktiskt kan anropa

OrcaRouter placerar video- och språkmodeller bakom en enda OpenAI-kompatibel slutpunkt på en nyckel, till leverantörens listpriser som förs vidare utan något påslag, så att en ändring av leverantörens pris slår igenom samma dag i stället för vid förnyelse. Vidu Q4 Preview och Seedance 2.5 är för närvarande inte OrcaRouter-rutter, och den här sidan antyder inte något annat. De videorutter vi faktiskt tillhandahåller – Kling 3.0 och dess Turbo- och v2.6-varianter bland dem – ligger bredvid språkmodellerna på samma slutpunkt och med samma förfrågningsformat, med automatisk failover mellan rutter i stället för ett separat avtal per modell.

Det är strukturen som gör en jämförelse som den här möjlig att slutföra: kör kandidaterna på din egen brief, med dina egna inställningar, och låt acceptansfrekvensen avgöra i stället för två prislistor i olika enheter.

A generated two-column scoreboard titled 'Vidu Q4 Preview vs Seedance 2.5 - the scoreboard'. The left column reads: Image references up to 15; Video references none; Audio references up to 3; Single-run length up to 16 seconds; Max resolution 4K generation; Billing unit per second by tier. The right column reads: Image references up to 30; Video references up to 10; Audio references up to 10; Single-run length up to 30 seconds; Max resolution 720p on published hosts; Billing unit tokens, per vendor. A footer reads 'Vidu figures per vendor docs; Seedance figures vendor-reported, unreproduced.'A screenshot of the Vidu API documentation for Vidu Q4 Preview, showing the left navigation with the Vidu Q4 Preview entry selected and the 'Image to Video' page open, including the Create Task endpoint, the Authorization header and a cURL request example whose body sets model to viduq4-preview with a duration and resolution and the audio parameter set true.A screenshot of the Artificial Analysis AA-Video-T2V v2.0 text-to-video leaderboard, read 8 October 2026, showing Wan 3.0 first at 1,156 Elo, Dreamina Seedance 2.5 third at 1,143 over 8,264 samples with an API price of $34.12 per minute, MiniMax H3 (768p) fourth at 1,137 and MiniMax H3 Max fifth at 1,130, with Vidu Q4 Preview absent from the board entirely.