
Vidu Q4 Preview vs. Alibaba Wan 2.7: Zwei Modi gegen vier und ein Board, auf das es ankommt
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Hier ist der ganze Vergleich in einer Zeile: Vidu Q4 Preview schlägt Alibaba Wan 2.7 um 102 Elo auf dem Image-to-Video-Board von Artificial Analysis und kann bei Text-to-Video oder Videobearbeitung nicht gegen ihn ins Rennen geschickt werden, weil Vidu Q4 Preview weder das eine noch das andere beherrscht.
Beide Modelle kamen 2026 auf den Markt und beide erzeugen Video mit Ton. Vidu Q4 Preview kam am 7. Oktober 2026 von Shengshu Technology als erste öffentliche Vorschau vor dem vollständigen Q4-Modell, in zwei Modi — Image-to-Video und Reference-to-Video. Alibaba Wan 2.7 wurde im April 2026 als Suite mit vier Varianten veröffentlicht: Text-to-Video, Image-to-Video, Reference-to-Video und Video-Edit, abgerechnet pro Sekunde des generierten Videos. Der Tie-Breaker auf den meisten Head-to-Head-Seiten — eine Punktzahl — existiert also nur auf einer der Achsen, und der ehrliche Weg, diese beiden zu beurteilen, besteht darin, zunächst zu fragen, welche Achsen man tatsächlich braucht.
Die Anzeigetafel, mit sichtbar belassenen Lücken
Artificial Analysis betreibt drei separate Video-Leaderboards. Jedes hat seine eigene Elo-Skala und seinen eigenen Stimmenpool, daher lässt sich eine Punktzahl von einem nicht auf ein anderes übertragen. Abgelesen am 8. Oktober 2026, wieder mit eingeschaltetem Audio:
• Bild-zu-Video (AA-Video-I2V v1.0) — Vidu Q4 Preview auf Platz 3, 1.179 ±10, 5.543 Stichproben, Okt. 2026, 7,20 $/Min.; Alibaba Wan 2.7 auf Platz 13, 1.077 ±8, 4.571 Stichproben, Apr. 2026, 9,00 $/Min.
• Text-zu-Video (AA-Video-T2V v2.0) — Vidu Q4 Preview nicht vorhanden; Wan2.7-260612 13.–14., 1.030 ±9, 5.571 Stichproben, Juni 2026, 9,00 $/Min.
• Videobearbeitung (AA-Video-Editing v1.1) — Vidu Q4 Preview nicht vorhanden; Wan 2.7 auf Platz 7, 1.074, 20.021 Beispiele, Apr. 2026, 16,90 $/Min.
Aus dieser Tabelle ergeben sich zwei Dinge. Wan 2.7 ist mit großem Abstand der vielseitigere der beiden – es ist das einzige von ihnen, das auf allen drei Boards bewertet wurde, und sein Editing-Eintrag weist die höchste Stimmenzahl aller Wan-2.7-Werte überhaupt auf, basierend auf zwanzigtausend Stichproben. Und auf der einzigen Achse, auf der sie sich treffen, gewinnt Vidu Q4 Preview mit 102 Elo, was in etwa dem Fünffachen der Breite des Konfidenzintervalls eines jeden der beiden Modelle entspricht.
Der Abstand von 102 Punkten ist kein unbedeutendes Ergebnis. Zum Vergleich: Die gesamte Spannweite über die sechs besten Plätze auf der Image-to-Video-Bestenliste beträgt 21 Elo. Vidu Q4 Preview liegt beim Image-to-Video nicht nur knapp vor Wan 2.7; es ist eine andere Liga, und es kostet 1,80 $ pro Minute weniger, während es zugleich die neuere Veröffentlichung ist. Wenn Image-to-Video Ihr Workload ist, fällt die Entscheidung nicht knapp aus, und die unabhängige Bestenliste ist der Grund dafür, dass sie nicht knapp ausfällt.

Wo Wan 2.7 der einzige der beiden ist, der angezeigt wird
Wan 2.7s eigene Dokumentation nennt zwei Bereiche, die noch Arbeit brauchen: die Audioqualität und die Genauigkeit von Bildschirmtext. Das ist die Einschätzung des Anbieters, nicht die eines Testers, und es lohnt sich, sie in jeden Vergleich mitzunehmen, denn beide Modelle erheben denselben zentralen Anspruch – natives Audio, das mit dem Bild entsteht, statt im Nachhinein angeflanscht zu werden.
Der Unterschied liegt darin, was standardmäßig passiert. Der Image-to-Video-Endpunkt von Vidu Q4 Preview verfügt über einen Audio-Parameter, der standardmäßig auf true steht: Sie erhalten Ton, es sei denn, Sie schalten ihn ab, und durch das Abschalten erhalten Sie einen stummen Clip. Wan 2.7 dokumentiert denselben Schalter nicht an derselben Stelle. Wenn stumme Ausgabe für Ihre Pipeline wichtig ist – und für alles, was Sie separat mit Musik unterlegen oder in eine andere Sprache synchronisieren möchten, ist sie das –, dann verändert diese Asymmetrie, wie Ihr erster Integrationsdurchlauf aussieht.
Auf dem Editing-Board ist Wan 2.7s siebter Platz bei 1.074 aus 20.021 Samples das stärkste Einzelergebnis, das eines der beiden Modelle gemessen an der Stimmenzahl auf irgendeinem Board vorzuweisen hat. Zwanzigtausend Stimmen sind eine Messung mit echtem Gewicht, und kein Vidu-Modell erscheint auf diesem Board, mit dem es verglichen werden könnte. Wenn es bei Ihrer Arbeit darum geht, vorhandenes Filmmaterial neu zu timen oder umzustylen, statt neue Shots zu generieren, ist Wan 2.7 der einzige der beiden, der infrage kommt.

Die Spezifikationslücke auf der Generierungsseite
Wo sie sich überschneiden, unterscheiden sich die beiden in fast jeder Hinsicht, und die Unterschiede fallen nicht symmetrisch zu Wan's Gunsten aus.
• Maximale Auflösung — Vidu Q4 Preview 4K (2K und 4K bei 10-Bit-Farbe) vs. Wan 2.7 bis zu 1080p
Maximale Clip-Länge — Vidu Q4 Preview 16 s (Bild-zu-Video 3–16 s, Referenz-zu-Video 1–16 s) vs. Wan 2.7 bis zu 15 s
• Referenzbilder — Vidu Q4 Preview bis zu 15 in einem einzigen Setup vs. Wan 2.7 bis zu zehn Assets
• Referenzaudio — Vidu Q4 Preview bis zu 3 Clips für Stimmkonsistenz im Vergleich zu nicht in derselben Detailtiefe von Alibaba veröffentlicht
• Aufgabenabdeckung — Vidu Q4 Preview mit zwei Modi (Bild-zu-Video, Referenz-zu-Video) im Vergleich zu Wan 2.7 mit vier Varianten (zusätzlich Text-zu-Video und Videobearbeitung)
• Veröffentlichter Listenpreis — Vidu Q4 Preview ab 0,014 $/s (Aktionspreis); gemessen 7,20 $/min auf dem unabhängigen Board vs. Wan 2.7 0,10–0,15 $/s je Variante, 9,00 $/min gemessen
Die Auflösung ist der Punkt, den man sorgfältig abwägen sollte. 4K-Ausgabe mit 10 Bit ist ein echter Unterschied beim Endprodukt für alle, die für einen Bildschirm oder ein großes Display finishen, und es ist kein Feature, das Wan 2.7 in irgendeiner Variante bietet. Doch 4K ist auch der Punkt, an dem die Preisgestaltung pro Sekunde gewöhnlich aufhört, wie die beworbene Untergrenze auszusehen, und Vidus eigenes Launch-Material enthält den Hinweis, dass endgültige Preise, unterstützte Auflösungen, Verfügbarkeit von Funktionen und Nutzungsbedingungen je nach Tarif und Region variieren.

Welche, nach Arbeitslast
Wenn Sie Standbilder animieren – Produktaufnahmen, Charakter-Referenzframes, Storyboards –, ist Vidu Q4 Preview gemessen an der einzigen verfügbaren unabhängigen Evidenz das bessere Modell, zu einer niedrigeren gemessenen Rate. Das ist der eindeutige Fall.
Wenn Sie einen einzigen Vertrag brauchen, der Text-zu-Video, Bild-zu-Video und Editing abdeckt, ist Wan 2.7 der einzige der beiden, der darauf antwortet – und das mit einem siebten Platz im Editing, der auf der höchsten Stimmenzahl beruht, die eines der beiden Modelle aufzuweisen hat. Die Konsolidierung auf einen einzigen Anbieter ist ein echter Vorteil, und dieser Vergleich tut nicht so, als wäre es anders.
Wenn Sie beides benötigen, sind die Kosten für den Betrieb zweier Anbieter normalerweise nicht die Lizenz — es sind die zweite Integration, der zweite Schlüssel, die zweite Retry-Semantik und das zweite Schema, das aktuell gehalten werden muss. OrcaRouter fasst das zusammen: ein OpenAI-kompatibler Endpunkt über mehr als 200 Modelle hinweg, Listenpreise der Anbieter ohne Aufschlag durchgereicht und automatisches Failover über Anbieter hinweg. Speziell auf der Videoseite bieten wir MiniMax H3 an, das derzeit auf dem oben stehenden Image-to-Video-Board die Plätze eins und zwei belegt — aufrufbar über denselben Endpunkt und denselben Schlüssel wie die Textmodelle. Weder Vidu Q4 Preview noch Alibaba Wan 2.7 ist heute eine OrcaRouter-Route, und diese Seite sollte nicht so gelesen werden, als würde sie etwas anderes implizieren; was wir tun können, ist, den Rest der Workload auf einer Integration zu halten, damit das Videoexperiment ein Einzelposten statt eines Projekts ist.
Was würde das ändern?
Vidu Q4 Preview ist eine Vorschau. Die Preisgestaltung ist werblich, der Build liegt nach eigener Aussage des Anbieters vor der vollständigen Q4-Veröffentlichung, und die API-Dokumentation führt neben dem korrekten weiterhin einen falsch geschriebenen Modell-Alias auf. Zwei Ergebnisse sind entscheidend: Wenn die vollständige Q4-Veröffentlichung Text-zu-Video hinzufügt, fallen die Achsen zusammen und dies wird zu einem direkten Vergleich auf drei Boards statt einem; wenn nicht, bleibt die Aufteilung so, wie sie ist, und die Wahl dreht sich ausschließlich um die Form der Arbeitslast.
Andererseits sind Wan 2.7s Beispiele auf dem Bild-zu-Video-Board fünf Monate älter als die von Vidu und etwa tausend weniger. Beide Abstände werden sich verkleinern. Die Platzierung keines der beiden Modelle sollte über das daneben angegebene Datum hinaus als fest betrachtet werden.
Die enge Antwort: Sie teilen sich genau eine Wettbewerbsachse, Vidu Q4 Preview führt sie klar bei einer niedrigeren gemessenen Rate an, und Wan 2.7 gewinnt standardmäßig überall dort, wo Vidu nicht konkurriert. Die weite Antwort ist, dass ein Zwei-Modus-Vorschaumodell und eine Suite mit vier Varianten nicht wirklich Alternativen zueinander sind — sie sind Alternativen für unterschiedliche Aufgaben, und der nützliche Teil dieses Vergleichs ist zu wissen, welche Aufgabe man hat.
