Eine generierte Titelkarte mit der Aufschrift „Vidu Q4 Preview vs. Seedance 2.5", dem Untertitel „Fünfzehn Referenzen gegen dreißig, plus eine Videoeingabe" und zwei Karten, wobei auf der linken „Vidu Q4 Preview: 15 Bilder, 3 Audioclips, 16 Sekunden, bis zu 4K" und auf der rechten „Seedance 2.5: 30 Bilder, 10 Videos, 10 Audioclips, 30 Sekunden pro Durchlauf" steht. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Vidu Q4 Preview vs. Seedance 2.5: Das Referenz-Budget ist nicht der eigentliche Unterschied

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die veröffentlichten Referenzbudgets lesen sich wie ein klarer Sieg für Seedance 2.5: bis zu 30 Bilder, 10 Videos und 10 Audioclips gegenüber Vidu Q4 Previews 15 Bildern und 3 Audioclips. Das sind doppelt so viele Bilder und dreimal so viel Audio, und für sich genommen würde das die Frage entscheiden. Tut es aber nicht, denn die Zahl, auf die es ankommt, ist nicht die Anzahl — es ist die zweite Modalität. Seedance 2.5 akzeptiert Video als Eingabereferenz. Vidu Q4 Preview akzeptiert Bilder und Audio und hat keinen dokumentierten Weg, einen vorhandenen Clip als Eingabe zu verwenden.

Seedance 2.5 startete am 31. Juli 2026 als ByteDances Longform-Einstieg und erzeugt in einem einzigen Durchlauf einen 30-Sekunden-Clip, mit Multi-Turn-Erweiterung für längere Sequenzen. Vidu Q4 Preview wurde am 7. Oktober 2026 von Shengshu Technology als Vorschau auf das eigene Flaggschiff der nächsten Generation veröffentlicht, mit zwei Modi – Image-to-Video und Reference-to-Video – und zwei dokumentierten API-Endpunkten. Beide sind referenzlastige Modelle. Sie wurden gebaut, um unterschiedliche Dinge aufzunehmen.

Was jede Eingabemodalität tatsächlich freischaltet

Ein Modell, das Bilder als Referenzen verwendet, kann eine Besetzung und einen Look beibehalten. Die Dokumentation von Vidu Q4 Preview beschreibt das Kombinieren von 1–15 Bildern über Charaktere, Szenen und Stil hinweg, damit Subjekte über einen Multi-Shot-Take hinweg konsistent bleiben, mit bis zu 3 MP3-Audioreferenzen von 3–12 Sekunden, die eine Stimme klonen und die Vortragsweise abgestimmt halten. Fünfzehn Slots über Besetzung, Garderobe, Requisiten und Beleuchtung einer einzelnen Szene hinweg sind ein kohärentes Budget, und das ist der Grund, warum das Modell an der Spitze des Image-to-Video-Präferenz-Boards gleichauf liegt.

Ein Modell, das auch Video als Referenz heranzieht, kann auf Filmmaterial gerichtet werden. Dass Seedance 2.5 bis zu 10 Videoeingaben neben 30 Bildern und 10 Audioclips akzeptiert, bedeutet, dass das Referenzset Bewegung, Tempo und Kameravehalten aus einem vorhandenen Clip beziehen kann, statt im Prompt beschrieben zu werden. Das ist eine andere Fähigkeit, nicht eine größere Version derselben, und genau das bringt Seedance 2.5 auf das Video-Editing-Board bei Artificial Analysis – auf Platz zwei, bei 1.161 Elo aus 5.162 Stimmen, abgelesen am 8. Oktober 2026 –, wo ein Video anhand einer Textanweisung bearbeitet wird, wobei das Audio erhalten bleibt. Vidu Q4 Preview steht nicht auf diesem Board, und der Grund dafür ist seine Endpunktliste, nicht sein Score.

Der praktische Kontrast:

• Bildreferenzen — Vidu Q4 Preview bis zu 15 vs. Seedance 2.5 bis zu 30

• Videoreferenzen — Vidu Q4 Preview: keine dokumentiert vs. Seedance 2.5: bis zu 10

• Audio-Referenzen — Vidu Q4 Preview bis zu 3 MP3-Clips von 3–12 Sekunden vs. Seedance 2.5 bis zu 10

• Länge pro Durchlauf – Vidu Q4 Preview 3–16 Sekunden bei Image-to-Video, 1–16 Sekunden bei Reference-to-Video vs. Seedance 2.5 30 Sekunden in einem Durchlauf, mit Multi-Turn-Erweiterung darüber hinaus

• Modi — Vidu Q4 Preview Image-to-Video und Reference-to-Video vs. Seedance 2.5 Text-to-Video, Reference-to-Video und Video-in-Reference, mit einer Bearbeitungsroute auf dem Board

• Ausgabeauflösung — Vidu Q4 Preview 540p bis 4K als preisgestaffelte Generierungsstufen, 2K und 4K mit 10-Bit-Farbe gegenüber Seedance 2.5 mit 480p und 720p auf den Hosts, die seine Einstellungen veröffentlichen, wobei höhere Stufen die Auslieferungsauflösung durch ein Upscaling erreichen

Stellt man sie nebeneinander, konkurrieren die Modelle nicht um dasselbe Briefing. Ein 4K-Take von sechzehn Sekunden mit fünfzehn Referenzen und ein 720p-Take von dreißig Sekunden mit dreißig Referenzen und Videoeingabe sind Antworten auf zwei unterschiedliche Produktionsfragen.

Die Preiseinheiten konvertieren nicht, und das ist die ganze Geschichte.

Hier gehen die meisten Vergleiche dieser beiden schief, und der Fehler liegt in der Einheit, nicht in der Arithmetik.

Seedance 2.5 wird von seinem Anbieter nicht sekundenweise verkauft. ByteDance rechnet das Modell in Video-Tokens auf der offiziellen Preisliste ab, die in China über Volcano Engine Ark und international über BytePlus ModelArk veröffentlicht wird. Was ein Clip kostet, hängt von Auflösung, Dauer und tatsächlichem Token-Verbrauch ab, sodass ein Sekundenpreis nur für eine Auflösung und eine Dauer gilt — und fehlgeschlagene Takes werden genauso abgerechnet wie erfolgreiche. Drittanbieter-Hosts, die Seedance 2.5 anbieten, schlagen ihre eigene Marge auf und veröffentlichen ihren eigenen Sekunden- oder Clip-Preis, weshalb ein Dutzend Seiten ein Dutzend unterschiedliche Zahlen nennt und keine davon die des Anbieters ist.

Vidu Q4 Preview wird andersherum bepreist: eine einheitliche Credit-Rate pro Sekunde, die sich nur nach der von Ihnen gewählten Auflösungsstufe richtet und offen von Shengshu veröffentlicht wird. Neun Credits pro Sekunde bei 540p, 19 bei 720p, 24 bei 1080p, 38 bei 2K, 78 bei 4K, gegenüber einem angegebenen Plattform-Credit-Preis von 0,005 $, wobei derzeit zeitlich begrenzte Bundle-Rabatte von bis zu 30 % laufen. Zum Listenpreis verläuft die Kurve von etwa 0,045 $ pro Sekunde bei 540p bis etwa 0,39 $ bei 4K. Die Angabe von 0,014 $ pro Sekunde aus der Startankündigung ist die 540p-Stufe mit angewendetem Rabatt.

Was bedeutet, dass die beiden Tarifkarten nicht Zeile für Zeile verglichen werden können, und jede Seite, die das tut, vergleicht die offene Preisliste eines Anbieters mit dem Aufschlag eines Hosts. Vergleichen lässt sich, was der Anbieter über die Beschaffenheit der jeweiligen Abrechnung veröffentlicht: Vidus Kosten skalieren mit Auflösung und Dauer und sind bekannt, bevor man auf Generieren drückt; Seedance wird nach Tokens abgerechnet und hängt daher davon ab, wie das Modell Tokens für den Prompt auszugeben beschließt. Das eine ist vorhersehbar, das andere wird nach Verbrauch abgerechnet. Keines von beiden ist falsch, aber sie passen zu unterschiedlichen Käufern – und das zweite ist von den beiden das riskantere für die Budgetplanung, weil die Varianz auf der Seite des Anbieters liegt.

Auf dem unabhängigen Board sind die erfassten Werte pro Minute nur als Größenordnung zu verstehen. Artificial Analysis verzeichnet Vidu Q4 Preview mit 7,20 $ pro Minute auf dem Image-to-Video-Board und Dreamina Seedance 2.5 mit 34,12 $ pro Minute auf dem Text-to-Video-Board sowie 40,82 $ beim Editing. Diese Spalten geben die Kosten für eine Minute 1080p-Output bei den Standardeinstellungen des jeweiligen Modells an – und Seedance 2.5 verwendet standardmäßig die längere, schwerere Konfiguration, für die seine Preisliste gilt, während der Standard bei Vidu Q4 Preview ein Clip aus einer einzigen Generierung ist. Sie messen unterschiedliche Standardverhalten, nicht einen vier- bis fünffachen Effizienzunterschied.

Sechzehn Sekunden gegen dreißig sind ein echter Unterschied

Es gibt einen Vergleich, der das Einheitenproblem tatsächlich übersteht, und zwar die Länge. Dreißig Sekunden bei Vidu Q4 Preview sind fast doppelt so lang wie die Obergrenze von sechzehn Sekunden bei Seedance 2.5, und die Multi-Turn-Erweiterung von Seedance 2.5 bedeutet, dass eine Sequenz darüber hinaus aufgebaut werden kann. Bei erzählerischer Arbeit – eine Szene mit einem Bogen, ein Werbespot mit Aufbau und Payoff – ist der Unterschied zwischen sechzehn und dreißig Sekunden der Unterschied zwischen einer Einstellung und einer Szene.

Am unteren Ende schlägt es in die andere Richtung aus. Vidu Q4 Preview generiert ab drei Sekunden, und seine 540p-Stufe kostet etwa ein Drittel seines eigenen 720p-Tarifs, was das Blocking einer Komposition günstig macht, bevor man sich auf ein Rendering in voller Auflösung festlegt. Nichts in der veröffentlichten Tarifstruktur von Seedance 2.5 erfüllt diese Rolle: Seine 480p-Host-Stufe kostet weniger als 720p, doch die Abrechnung des Anbieters selbst erfolgt tokenbasiert, sodass ein kurzer Test in niedriger Auflösung keinen eindeutigen veröffentlichten Preis hat, an dem man die Planung ausrichten könnte.

Welche, kurz gesagt?

Nimm Seedance 2.5, wenn es bei der Aufgabe um bereits vorhandenes Material geht. Wenn die Arbeit darin besteht, einen vorhandenen Clip zu verlängern, neu zu gestalten oder neu zu schneiden, oder wenn das Referenzset Bewegung statt nur Aussehen transportieren muss, ist die Videoeingabe die entscheidende Fähigkeit, und Vidu Q4 Preview kann dafür nicht als Ersatz eingesetzt werden. Nimmt man den 30-Sekunden-Einzellauf hinzu, ist der Fall für erzählerische und Werbearbeit mit einem längeren Bogen eindeutig.

Nimm Vidu Q4 Preview, wenn es um eine Besetzung geht, die standhalten muss, und um eine Liefervorgabe, die über 720p hinausgeht. Native 2K- und 4K-Generierung mit 10-Bit-Farbe ist eine Stufe, die Seedance 2.5 auf Anbieterebene nicht veröffentlicht, und der Sekundenpreis macht einen 4K-Take zu einer Größe, die sich tatsächlich budgetieren lässt, statt zu einer ungewissen, verbrauchsabhängig abgerechneten Größe. Fünfzehn Bildreferenzen und drei Stimmreferenzen reichen für eine Besetzung mit einer einzigen Szene, und die 540p-Blocking-Stufe macht Iteration günstig.

Was das ändern würde: Ein vollständiges Vidu-Q4-Release, das eine Video-Eingabemodalität hinzufügt, würde den strukturellen Unterschied auflösen und diese beiden zu direkten Konkurrenten machen, und Shengshus eigenes Material besagt, dass die Vorschau genau dazu existiert, das Feedback zu sammeln, das den finalen Build prägt. Auf der anderen Seite: Wenn ByteDance eine Beispieltabelle für Token-Raten für mehr Einstellungen veröffentlicht, lässt sich die Asymmetrie zwischen verbrauchsbasierter und planbarer Abrechnung viel leichter einplanen. Bis eines von beiden eintrifft, ist die korrekte Lesart von „30 Referenzen gegenüber 15“, dass eines dieser Modelle Video als Eingabe akzeptiert und das andere nicht.

Ein Schlüssel für die Videomodelle, die man tatsächlich aufrufen kann

OrcaRouter stellt Video- und Sprachmodelle hinter einem einzigen OpenAI-kompatiblen Endpoint unter einem einzigen Schlüssel bereit, zu den Listenpreisen der Anbieter, die ohne Aufschlag durchgereicht werden, sodass eine Preisänderung eines Anbieters noch am selben Tag greift und nicht erst bei der Vertragsverlängerung. Vidu Q4 Preview und Seedance 2.5 sind derzeit keine OrcaRouter-Routen, und diese Seite behauptet auch nichts anderes. Die Video-Routen, die wir tatsächlich bedienen — Kling 3.0 und seine Varianten Turbo und v2.6 — stehen neben den Sprachmodellen am selben Endpoint und mit derselben Request-Struktur, mit automatischem Failover zwischen den Routen statt eines separaten Vertrags pro Modell.

Das ist die Struktur, die einen Vergleich wie diesen abschließbar macht: Lassen Sie die Kandidaten mit Ihrem eigenen Briefing und Ihren eigenen Einstellungen laufen und lassen Sie die Akzeptanzrate entscheiden statt zwei Tarifkarten in unterschiedlichen Einheiten.

A generated two-column scoreboard titled 'Vidu Q4 Preview vs Seedance 2.5 - the scoreboard'. The left column reads: Image references up to 15; Video references none; Audio references up to 3; Single-run length up to 16 seconds; Max resolution 4K generation; Billing unit per second by tier. The right column reads: Image references up to 30; Video references up to 10; Audio references up to 10; Single-run length up to 30 seconds; Max resolution 720p on published hosts; Billing unit tokens, per vendor. A footer reads 'Vidu figures per vendor docs; Seedance figures vendor-reported, unreproduced.'A screenshot of the Vidu API documentation for Vidu Q4 Preview, showing the left navigation with the Vidu Q4 Preview entry selected and the 'Image to Video' page open, including the Create Task endpoint, the Authorization header and a cURL request example whose body sets model to viduq4-preview with a duration and resolution and the audio parameter set true.A screenshot of the Artificial Analysis AA-Video-T2V v2.0 text-to-video leaderboard, read 8 October 2026, showing Wan 3.0 first at 1,156 Elo, Dreamina Seedance 2.5 third at 1,143 over 8,264 samples with an API price of $34.12 per minute, MiniMax H3 (768p) fourth at 1,137 and MiniMax H3 Max fifth at 1,130, with Vidu Q4 Preview absent from the board entirely.