Eine generierte Titelkarte mit der Aufschrift 'Vidu Q4 Preview vs MiniMax H3' und dem Untertitel 'Sechzehn Elo Abstand, drei Boards Abstand' sowie drei Statistik-Kacheln mit den Werten '1.195 MiniMax H3 Max', '1.181 MiniMax H3' und '1.179 Vidu Q4 Preview', jeweils mit der Bildunterschrift 'Bild-zu-Video-Elo'. Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Vidu Q4 Preview vs. MiniMax H3: Die Spitze des Boards ist ein Gleichstand, und nur eines von ihnen ist auf drei Boards vertreten.

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die Bild-zu-Video-Rangliste bei Artificial Analysis, abgerufen am 8. Oktober 2026, führt MiniMax H3 Max mit 1.195 Elo auf Platz eins, MiniMax H3 mit 1.181 auf Platz zwei und Vidu Q4 Preview mit 1.179 auf Platz drei. Sechzehn Punkte trennen den ersten vom dritten Platz, bei Intervallen von ungefähr ±10 und ±11, bei 5.894, 7.284 bzw. 5.543 Stimmen. Das ist ein statistisches Unentschieden, das sich als Siegerpodest verkleidet, und jede Seite, die damit beginnt, auf dieser Rangliste einen Sieger zu verkünden, liest nur Rauschen.

Die interessante Frage ist also nicht, welches dieser beiden Modelle besser ist. Sondern was mit dem Vergleich passiert, sobald man von dem einen Board heruntersteigt, auf dem beide erscheinen — denn MiniMax H3 wurde am 31. Juli 2026 als omni-modales Modell veröffentlicht, das Text-, Bild-, Video- und Audioreferenzen als einen einzigen Kontext liest, und Vidu Q4 Preview erschien am 7. Oktober 2026 mit zwei Eingabemodi und zwei API-Endpunkten. Eines von ihnen wird an drei Stellen gemessen. Das andere an einer.

Was der Dreiergleichstand bedeutet – und was nicht

Sowohl die beiden MiniMax-Einträge als auch der Vidu-Build liegen innerhalb der Intervalle des jeweils anderen, sodass die ehrliche Aussage lautet, dass die drei besten Image-to-Video-Modelle bei den aktuellen Stichprobengrößen anhand menschlicher Präferenz nicht unterscheidbar sind. Zwei Details machen dieses Unentschieden weniger schmeichelhaft für alle, als es klingt.

Das Erste ist das Alter. Die Stimmen von MiniMax H3 stammen aus Juli 2026, die von H3 Max aus August; die von Vidu Q4 Preview aus Oktober. Größere, ältere Stimmenpools werden an einem anderen Wettbewerbsfeld und einer anderen Gruppe von Gegnern gemessen, was in beide Richtungen wirkt: besser gemessen, und es geht um eine etwas andere Frage. Ein Abstand von 16 Punkten in die eine oder andere Richtung ist hier kein Beweis.

Die zweite ist die Preisspalte. Artificial Analysis verzeichnet MiniMax H3 auf diesem Board mit 7,80 $ pro Minute und H3 Max mit 4,80 $ pro Minute. Vidu Q4 Preview wird mit 7,20 $ geführt. Liest man diese Werte als Ranking, wirkt H3 Max wie die Preis-Leistungs-Wahl unter den dreien – doch die zugrunde liegenden Anbieterpreise erklären das Etikett, statt ihm zu widersprechen. Auf unserer eigenen Modellkarte führen wir MiniMax-H3 mit 0,08 $ pro Sekunde bei 768P und 0,13 $ pro Sekunde bei 2K, was 4,80 $ bzw. 7,80 $ pro Minute entspricht. Die beiden MiniMax-Werte auf dem Board sind dasselbe Modell, bepreist in zwei Auflösungsstufen, nicht eine Premium-Stufe und eine Billigstufe. Pro-Minute-Spalten auf einem Präferenz-Board sind nützlich für Größenordnungen und gefährlich für alles Feinere.

Wo MiniMax H3 auftaucht und Vidu Q4 Preview nicht

Dies ist der Teil des Duells, der das Unentschieden übersteht, und es ist ein struktureller Unterschied, kein qualitativer.

MiniMax H3 (768p) liegt mit 1.137 Elo bei 8.315 Stimmen auf dem Text-zu-Video-Board auf Platz vier, H3 Max folgt mit 1.130 bei 5.719 Stimmen auf Platz fünf. Auf dem Video-Editing-Board liegt es mit 1.119 bei 7.023 Stimmen erneut auf Platz vier – auf einem Board, das Modelle danach bewertet, wie sie ein Video anhand einer Textanweisung bearbeiten, wobei der Ton erhalten bleibt. Vidu Q4 Preview erscheint auf keinem von beiden.

Dieses Fehlen ist keine Messlücke – es ist das, was das Produkt ausmacht. Die API von Vidu Q4 Preview dokumentiert zwei Endpunkte, /ent/v2/img2video und /ent/v2/reference2video, und die Produktseite listet zwei Modi auf, Image-to-Video und Reference-to-Video. In der Dokumentation gibt es keinen Text-zu-Video-Pfad. Es gibt auch keinen Videobearbeitungspfad, was bedeutet, dass das Modell keinen vorhandenen Clip nehmen und etwas darin ändern kann. MiniMax H3 kann beides, und seine omni-modale Ausrichtung – Text-, Bild-, Video- und Audioreferenzen in einem Kontext – ist der Grund dafür.

Es lohnt sich, beim Audio-Teil präzise zu sein, denn beide Modelle bieten natives Audio, und die beiden sind nicht dasselbe. Vidu Q4 Preview erzeugt Audio und Video gemeinsam, mit einem Audio-Parameter im Image-to-Video-Endpunkt, der ein Video mit Dialogen und Soundeffekten ausgibt, und es akzeptiert bis zu drei Referenz-Audioclips, um die Stimme einer Figur konsistent zu halten. MiniMax H3 gibt natives Stereo-Audio aus und akzeptiert Audio als Eingabemodalität neben Bildern und Video. Der Anwendungsfall der Referenzstimme ist Vidus spezifische Stärke; der Anwendungsfall „alles als Referenz" ist der von MiniMax.

Die Berechnung pro Sekunde, Stufe für Stufe

Beide Modelle rechnen sekundengenau nach generierter Ausgabe ab, was dies zu dem seltenen Vergleich macht, bei dem sich die Preislisten ohne Umrechnung direkt gegenüberstellen lassen.

• 540p — nur bei Vidu Q4 Preview: 9 Credits pro Sekunde, etwa 0,045 $ beim veröffentlichten Standard-Credit-Preis der Plattform von 0,005 $

• 720P / 768P — Vidu Q4 Preview 19 Credits pro Sekunde, etwa 0,095 $ gegenüber MiniMax-H3 0,08 $ pro Sekunde

• 1080p — Vidu Q4 Preview 24 Credits pro Sekunde, etwa 0,12 $ gegenüber MiniMax-H3 ohne veröffentlichte 1080p-Stufe

• 2K — Vidu Q4 Preview 38 Credits pro Sekunde, etwa $0,19 gegenüber MiniMax-H3 $0,13 pro Sekunde

• 4K — nur Vidu Q4 Preview: 78 Credits pro Sekunde, etwa $0,39

Das Muster, das sich daraus ergibt, ist nicht „das eine ist günstiger“. Die Preisuntergrenze von Vidu Q4 Preview liegt tatsächlich niedriger – seine 540p-Stufe ist eine Blocking-Stufe, die genau für den Einsatzzweck bepreist ist, für den sie verwendet wird: eine Komposition prüfen, bevor man für einen Full-Resolution-Render bezahlt, und nichts in der Preisliste von MiniMax spielt diese Rolle. MiniMax H3 ist bei 2K, der höchsten Stufe, die beide Modelle gemeinsam haben, um etwa ein Drittel günstiger. Und Vidus 4K-Stufe ist die einzige 4K-Generierungsstufe im Vergleich, zu einem Preis, der das widerspiegelt.

Der Einführungswert von 0,014 US-Dollar pro Sekunde, der mit Vidus Ankündigung einherging, ist die 540p-Stufe zu einem rabattierten Credit-Satz, kein allgemeiner Tarif. Die Plattform von Shengshu bietet derzeit zeitlich begrenzte Paketrabatte von bis zu 30 % auf Credit-Pakete an, die jede Stufe gemeinsam nach unten verschieben, statt die Form der Kurve zu verändern. Betrachten Sie die Listenpreiskurve als Vergleichsgrundlage und den Rabatt als vorübergehenden Ausgleich.

Auf unserer Seite: Wir routen MiniMax-H3. Es ist live auf der öffentlichen Modell-API unter minimax/minimax-h3, abgerechnet pro Sekunde generierter Ausgabe zum Listenpreis, durchgereicht ohne Aufschlag, aufrufbar über denselben OpenAI-kompatiblen Endpunkt wie jedes Textmodell, das wir anbieten. Vidu Q4 Preview ist keine OrcaRouter-Route, und diese Seite behauptet nichts anderes – die Videomodelle, die wir anbieten, liegen mit einem Schlüssel und einem Anfrageformat neben den Sprachmodellen, eine Konstellation, die den Vergleich mehrerer von ihnen günstig macht. Eine praktische Konsequenz der Preisweitergabe: Wenn ein Anbieter einen Sekundenpreis ändert, ist diese Änderung noch am selben Tag auf der Route sichtbar statt erst bei der Vertragsverlängerung.

Was „omni-modal“ in einer tatsächlichen Anfrage bringt

Der vereinheitlichte Kontext von MiniMax H3 lässt sich leicht als Funktionsliste lesen und dabei als Engineering-Unterschied übersehen. Ein Modell, das Video als Eingabereferenz akzeptiert, kann auf eine bestehende Einstellung gerichtet und gebeten werden, sie fortzuführen, zu verlängern oder neu zu stylen; ein Modell ohne Videoeingabe kann das nicht. Das ist der Mechanismus hinter der Präsenz von H3 auf dem Editing-Board, und es ist auch der Grund, warum der Ausgabebereich des Modells von 4–15 Sekunden weniger einschränkend ist, als die Zahl vermuten lässt – die Multi-Turn-Erweiterung ist der normale Weg, daraus eine längere Sequenz aufzubauen.

Die 16-Sekunden-Obergrenze von Vidu Q4 Preview gilt ebenfalls pro Generierung, und sein Reference-to-Video-Modus ist für Multi-Shot-Storytelling innerhalb dieses Fensters ausgelegt, wobei die Dokumentation intelligente Kamerawechsel und Konsistenz über mehrere Kamerapositionen hinweg beschreibt. Was er nicht bietet, ist eine Möglichkeit, einen Clip anzunehmen, den Sie bereits gedreht haben, und ihn zu verändern. Wenn Ihr Workflow mit Filmmaterial beginnt und nicht mit einem Standbild oder einem Referenzset, steht Ihnen eines dieser beiden Modelle schlicht nicht zur Verfügung, und keine Elo-Zahl schließt diese Lücke.

Welchen, je nach Job?

Nehmen Sie MiniMax H3, wenn die Eingabe etwas anderes als ein Bild oder ein Referenzset ist. Text-zu-Video, Video-zu-Video-Bearbeitung, Audio-Eingabe, Multi-Turn-Verlängerung über fünfzehn Sekunden hinaus oder eine Pipeline, in der das Modell den Anwendungsbereich von drei verschiedenen Boards abdecken muss – das ist H3s Terrain, und es ist das einzige der beiden, das irgendetwas davon bietet. Seine 2K-Rate ist zudem die günstigere der beiden in der obersten Stufe, die sie sich teilen.

Nimm Vidu Q4 Preview, wenn es um Konsistenz von Cast und Stimme geht, oder wenn du eine 4K-Generierungsstufe brauchst, oder wenn du einen günstigen 540p-Blocking-Pass möchtest, um einen Shot zu iterieren, bevor du dich festlegst. Fünfzehn Bildreferenzen und drei Audioreferenzen sind ein größeres veröffentlichtes Referenzbudget, als MiniMax dokumentiert, und kein anderes Modell in diesem Vergleich generiert nativ in 4K. Das schmalere Modusangebot ist der Preis dafür.

Was das ändern würde, wäre ein vollständiges Vidu Q4, das ein Text-zu-Video-Modell hinzufügen, die beiden in dieselbe Rangliste setzen und daraus einen direkten Wettstreit machen würde. AA-Video-I2V v2.0, das laut Ankündigung durchgängig 1080p und eine überarbeitete Ranglisten-Taxonomie bringen soll, würde die Stimmen an der Spitze der Rangliste ersetzen, statt sie neu zu sortieren — und es würde klären, ob das aktuelle Dreier-Unentschieden ein Unentschieden oder eine Messgrenze ist. Bis dahin ist die Zahl, die man sich merken sollte, sechzehn, mit dem Namen der Rangliste und dem Datum daneben.

Das Einzige, was es wert ist, vom Podest selbst mitzunehmen: Ein erster Platz, der sechzehn Elo über dem dritten liegt, ist bei so breiten Intervallen kein Ranking. Es sind drei Modelle, die menschliche Wähler nicht auseinanderhalten können, und die Entscheidung zwischen ihnen muss aus allem anderen auf dieser Seite kommen.

A generated two-column scoreboard titled 'Vidu Q4 Preview vs MiniMax H3 - the scoreboard'. The left column reads: Image-to-video Elo 1,179 (3rd); Text-to-video not present; Video editing not present; Max resolution 4K generation tier; Clip length 1-16 seconds; Price at 2K about 0.19 USD per second. The right column reads: Image-to-video Elo 1,181 (2nd); Text-to-video 4th, 1,137; Video editing 4th, 1,119; Max resolution 2K; Clip length 4-15 seconds; Price at 2K 0.13 USD per second. A footer reads 'All Elo and rank figures per Artificial Analysis, 8 Oct 2026; prices per vendor rate cards.'A screenshot of the Vidu API documentation for Vidu Q4 Preview, showing the left navigation with the Vidu Q4 Preview entry selected and the 'Image to Video' page open, including the Create Task endpoint, the Authorization header and a cURL request example whose body sets model to viduq4-preview with a duration and resolution and the audio parameter set true.A screenshot of the OrcaRouter model page for minimax/minimax-h3, showing MiniMax-H3 described as MiniMax's omni-modal video generation model and the Hailuo 3 generation, released July 31, 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio, billed per second of generated output at $0.08/s at 768P and $0.13/s at 2K, with an OpenAI-compatible code sample and a per-second price of $0.0800.