Eine Hero-Karte für „Tavus Griffin vs. Alibaba Wan 2.7“, mit zwei Chips mit der Aufschrift „Tavus Griffin — kein veröffentlichter Preis“ und „Alibaba Wan 2.7 — 9,00 $ pro Minute bei 1080p“, über sechs Zeilen: Erzeugt: ein Live-Gespräch; Dagegen: ein 2- bis 15-Sekunden-Clip; Griffin-Preis: keiner veröffentlicht; Wan-2.7-Preis: 9,00 $ pro Minute; Griffin-Status: Forschungsvorschau; Wan-2.7-Status: allgemein verfügbar. Fußzeile: „Die Wan-2.7-Tarife sind Listenpreise von Alibaba Cloud; Griffin ist eine Forschungsvorschau ohne Tarifkarte.“
Guides & Insights

Tavus Griffin vs. Alibaba Wan 2.7: Ein konversationelles Modell gegen ein generatives

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die verlockende Art, Tavus Griffin und Alibaba Wan 2.7 zu vergleichen, ist pro Videosekunde, und dieser Vergleich lässt sich nicht anstellen. Wan 2.7 hat eine veröffentlichte Preisliste — 9,00 US-Dollar pro Minute bei 1080p an den internationalen Singapur-Endpunkten von Alibaba Cloud, mit einer günstigeren Tarifstufe für Peking und Tokio — und Tavus Griffin hat überhaupt keine Preisliste, weil Griffin-Lite am 1. Oktober 2026 als Forschungsvorschau für ausgewählte vertrauenswürdige Tester hinter einem Anfrageformular erschienen ist. Was die beiden gemeinsam haben, ist ein Wort: Video. Darüber hinaus sind sie Antworten auf unterschiedliche Fragen. Den einen fragt man, was als Nächstes in einem Gespräch geschehen sollte; den anderen fragt man, wie eine beschriebene Szene aussieht. Der interessante Vergleich betrifft nicht die Qualität, sondern was jeder von Ihnen verlangt, bevor er überhaupt etwas produziert, und was Sie zurückbekommen.

Der Unterschied ist die Schleife, nicht die Auflösung.

Wan 2.7 generiert Clip für Clip anhand eines Prompts. Sie schreiben eine Beschreibung, erhalten ein Stück Filmmaterial, sehen es sich an und schreiben die nächste. Wan 2.7 ist eine Suite aus vier Modellen – Text-zu-Video, Bild-zu-Video, Referenz-zu-Video und Video-Edit – und die Interaktion ist grundlegend transaktional: eine Eingabe, eine gerenderte Ausgabe und eine Entscheidung darüber, ob man sie behält. Nichts daran läuft, während Sie noch entscheiden, was Sie anfordern möchten.

Griffin ist andersherum aufgebaut. Es ist ein Vollduplex-System: eine Engine für kontinuierliche Konversationsmodellierung, die Audio und Video aufnimmt und die Konversation in Abständen von unter einer Sekunde neu bewertet, entscheidet, ob sie schweigen, ein Signal geben, Backchannel-Signale senden oder den Turn übernehmen soll, und ausdrucksstarke Steuerungssignale aussendet, die einen Streaming-Sprachgenerator und einen Streaming-Videogenerator parallel ansteuern. Sie erzeugt 720p in 320-ms-Chunks aus einem einzigen Referenzfoto, und die entscheidende Behauptung ist, dass sich eine mitten im Satz getroffene Entscheidung innerhalb desselben Mini-Turns in der Stimme und im Gesicht zeigt. Der Maßstab dafür ist keine Bestenliste von Clips, sondern ob man es unterbrechen kann.

Einfach gesagt: Wan 2.7 beantwortet die Frage „Wie sieht diese Szene in Bewegung aus?“ Griffin beantwortet: „Was sollten dieses Gesicht und diese Stimme in den nächsten zweihundert Millisekunden tun, wenn die Person gerade pausiert hat?“

Preis, auf der einen Seite, wo es einen gibt

Die veröffentlichten Preise von Wan 2.7 gelten pro Sekunde generierten Videos, und die Tarifstufen sind innerhalb der Suite nicht einheitlich – ein Detail, das die meisten Vergleichsseiten auslassen.

• wan2.7-t2v und wan2.7-i2v — Abrechnung nur nach Ausgabedauer. International Singapur: 0,10 $/s bei 720p und 0,15 $/s bei 1080p, was dem Wert von 9,00 $/min entspricht, der in den Bestenlisten erscheint. Peking und Tokio listen 0,086 $/s und 0,143 $/s für dieselbe Arbeit.

• wan2.7-r2v (Reference-to-Video) – abgerechnet wird nach der Dauer des Eingabevideos, begrenzt auf fünf Sekunden, plus die Ausgabe. Speist du eine fünfsekündige Referenz in eine fünfzehnsekündige Generierung ein, werden dir zwanzig Sekunden in Rechnung gestellt.

• wan2.7-videoedit — Abrechnung nur auf Basis der Ausgabe, das Eingangsmaterial ist kostenlos.

Zu diesen Zahlen gehören zwei Lebenszyklus-Fakten. Alibaba hat auf seinen eigenen Bailian- und Qwen-Cloud-Oberflächen einen zeitlich begrenzten Einführungsrabatt von 30 % gewährt, der bis zum 23. September 2026 galt und inzwischen abgelaufen ist. Und die Außerbetriebnahmemitteilung (ID 118434) von Alibaba Cloud für Model Studio setzt am 10. Oktober 2026 mehrere ältere Modelle offline, darunter wan2.7-r2v und wan2.7-image. Das betrifft die Variantenebene und nicht die Außerbetriebnahme der Generation — wan2.7-t2v und wan2.7-i2v bleiben mit aktiven Preisen und Seiten, die erst am 11. September aktualisiert wurden, gelistet — aber wenn Referenz-zu-Video der Grund war, warum Sie sich 2.7 angesehen haben, dann hat dieser Weg ein Ablaufdatum.

Der Vergleich mit Griffin enthält eine ehrliche Aussage: Es gibt keinen Preis, den man neben den von Wan 2.7 stellen könnte, weil Tavus keinen veröffentlicht hat. Griffin-Lite ist nicht auf der Tavus-Plattform, in der Ankündigung heißt es, dass es zum jetzigen Zeitpunkt nicht für die Nutzung durch Kunden verfügbar sein wird, und der eigene Schlusssatz des Unternehmens lautet, dass Griffin kommen wird, sobald es herausgefunden hat, wie es sicher veröffentlicht werden kann. Es gibt keinen Preis pro Sekunde, keinen Preis pro Anfrage, keine kostenlose Tarifstufe, keine Enterprise-Tarifstufe. Wer einen Preis für Griffin nennt, erfindet ihn.

Qualitätsbewertungen: zwei Gremien, die nicht tagen

Die beiden Modelle wurden mit völlig unterschiedlichen Instrumenten bewertet, weshalb es keinen Elo-Vergleich zwischen ihnen gibt.

Wan 2.7 hat zwei Einträge in der Video Arena von Artificial Analysis, und sie liegen nicht an derselben Stelle – das ist die Falle, wenn man eine einzige Zahl dafür zitiert. Das Elo dort leitet sich aus blinden paarweisen menschlichen Präferenzstimmen ab, einer Methodik, die für kurze generierte Clips entwickelt wurde, und beide untenstehenden Werte stammen von Ranglisten, die am 2. Oktober 2026 ausgelesen wurden.

• Wan2.7-260612 (der Juni-Build) bei Text-zu-Video (mit Audio) — 13.–14. Platz, Elo 1.032 (±10) bei 4.645 Stimmen, 9,00 $/Min.

• Wan 2.7 (April-Build) im Bereich Bild-zu-Video (mit Audio) — 12. von 34, Elo 1.077 bei 4.571 Stimmen, 9,00 $/min, ein Leaderboard, das ungefähr dieselbe Stimmenanzahl aufweist, es aber deutlich höher platziert.

• Wan 3.0, das neuere Geschwistermodell — 1. bei Elo 1.157 bei Text-zu-Video und 6. bei 1.164 bei Bild-zu-Video, beide bei $12,00/min. Das ist die Zahl, die man kennen sollte, bevor man Wan 2.7 mit irgendetwas vergleicht: Alibabas eigene nächste Generation ist ein Tabellenerster und 2.7 ist ein Mittelklasse-Build.

A screenshot of the top of Artificial Analysis's "AA-Video-T2V v2.0" leaderboard, text-to-video with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157 with 7,575 votes and $12.00/min; Utopai X (based on MiniMax H3) second at 1,150; Dreamina Seedance 2.5 third at 1,144; MiniMax H3 (768p) fourth at 1,139 and $4.80/min; MiniMax H3 Max fifth at 1,134; FLUX 3 sixth at 1,127; Gemini Omni Flash eighth at 1,117 and $9.12/min; Wan2.7-260612 thirteenth at 1,032 with 4,645 votes and $9.00/min; and the two Kling 3.0 1080p tiers sixteenth, at Elo 1,018 and Elo 1,000.

Griffin basiert auf NVIDIAs VideoFDB, einem Benchmark für Vollduplex-Audio-Video-Konversation, den NVIDIA im September 2026 unabhängig entwickelt und bewertet hat, unter Verwendung eines Sprachmodell-Bewerters nach einer Null-bis-Fünf-Rubrik. Griffin-Lite erzielte 3,83 im Generierungs-Track gegenüber einer menschlichen Referenz von 3,92 und 2,80 für das nächstbeste veröffentlichte System, sowie 3,73 im Wahrnehmungs-Track gegenüber einer menschlichen Referenz von 4,20. Tavus berichtet außerdem von 0,43 Sekunden echter Audio-zu-Video-Latenz für den Generator gegenüber vier veröffentlichten Streaming-Diffusions-Baselines auf H100s.

Beide Zahlenreihen sind legitim, und keine von beiden lässt sich übertragen. Elo in der Arena ist eine Stimmenzahl zur Clip-Präferenz; VideoFDB ist die Rubrikbewertung eines Judges zum Gesprächsverhalten. Es gibt keine Brücke zwischen ihnen, und die Falle der kleinen Stichprobe wirkt auch in die andere Richtung: Das ±10-Band der Arena bei Wan 2.7 ist breit genug, dass seine Platzierung gegenüber Nachbarn nicht eng aufgelöst ist, und NVIDIAs Generationslücke von 0,09 Punkten zum Menschen ist auf einer Fünf-Punkte-Rubrik klein genug, dass „nahe an der menschlichen Referenz“ die ehrliche Lesart ist, nicht „auf menschlichem Niveau“. Der Wahrnehmungsvergleich ist ebenfalls kein Äpfel-mit-Äpfel-Vergleich – mehrere der Systeme, vor die Griffin gesetzt wird, darunter OpenAIs gpt-realtime und MiniCPM-o 4.5, werden in reinen Audio-Konfigurationen bewertet, während Griffin auch Video wahrnimmt. Ein Teil des 0,29-Punkte-Vorsprungs misst, Augen zu haben.

Was jeder von Ihnen braucht

Hier wird der Vergleich nützlich, denn die Eingaben sind die Produkte.

Eingabe — Wan 2.7 nimmt Text, ein Bild, ein Video und Audio entgegen. Griffin erfasst eine Live-Person über Kamera und Mikrofon und generiert auf Anfrage überhaupt keinen Clip.

• Ausgabe — Wan 2.7 erzeugt eine Videodatei, 2 bis 15 Sekunden pro Generierung, bis zu 1080p, mit nativem Audio. Griffin erzeugt eine fortlaufende Konversation: 720p-Video mit 25 fps in 320-ms-Chunks, in Echtzeit generiert und abgespielt, während es dekodiert wird.

• Wodurch es gesteuert wird — Wan 2.7 wird durch den Prompt und durch bis zu fünf Subjektbilder und fünf Referenzclips gesteuert, bei einer Obergrenze von zehn Referenz-Assets pro Anfrage. Griffin wird durch das gesteuert, was die Person tut: eine Pause, ein Blick zur Seite, eine Geste, eine Unterbrechung.

• Zeithorizont — Wan 2.7s Arbeitseinheit ist ein Clip von höchstens fünfzehn Sekunden, den du dann zusammensetzt. Griffins Arbeitseinheit ist ein Gespräch, weshalb die Architektur Drift lösen musste — die dreistufige Destillation in einen autoregressiven Generator, trainiert auf seiner eigenen generierten Historie, damit lange Rollouts stabil bleiben — statt für eine längere einzelne Generierung zu kämpfen.

• Ausgabe-Container — Wan 2.7 liefert eine Datei zurück, die Ihnen gehört und die Sie bearbeiten, farbkorrigieren und verteilen können. Griffin liefert eine gerenderte Session zurück. Es gibt keine Datei zum Bearbeiten, weil die Pixel pro Chunk aus einem Referenzfoto und der eigenen Historie des Modells generiert werden und der Hintergrund, die Schatten und der Stuhl, auf dem die Person sitzt, Teil der Generierung sind.

Ein struktureller Unterschied, der genannt werden sollte: Wan 2.7s Kosten skalieren mit der Ausgabedauer, und seine Qualität skaliert damit, wie spezifisch dein Prompt ist. Griffins Kosten sind ungemessen, und seine Qualität skaliert damit, wie natürlich die Person am anderen Ende ist. Das eine lässt sich verbessern, indem man bessere Briefings schreibt, das andere nur, indem man es mit echten Menschen nutzt.

A screenshot of the top of Artificial Analysis's "AA-Video-I2V v1.0" leaderboard, image-to-video with audio, captured 2 October 2026: MiniMax H3 Max first at Elo 1,195; MiniMax H3 second at 1,181; Gemini Omni Flash third at 1,178; Dreamina Seedance 2.0 720p fourth at 1,176; HiDream-O1-Video-1.0 fifth at 1,175; Wan 3.0 sixth at 1,164 with 9,302 votes and $12.00/min; Veo 3.1 eleventh at 1,082; and Wan 2.7 twelfth at Elo 1,077 with 4,571 votes and $9.00/min. A note above the table says "AA-Video-I2V v2.0 is coming soon".

Referenz und Konsistenz, wo die beiden Designs kollidieren

Wan 2.7 steuert die Konsistenz des Motivs über mitgelieferte Referenzen: fünf Motivbilder, fünf Referenzclips, insgesamt zehn Assets. Es ist ein fotografischer Ansatz – du zeigst ihm, wie das Motiv aussieht, und es behält dieses Aussehen über die gesamte Generierung hinweg bei.

Griffin steuert dasselbe auf umgekehrtem Weg. Es erzeugt in Echtzeit jeden Pixel in jedem Frame aus einem einzigen Referenzbild, und in der Ankündigung heißt es ausdrücklich, dass es die gesamte Szene steuert und nicht nur das Gesicht: die Arme und Finger, die Bewegung des Stuhls, die geworfenen Schatten und den Hintergrund dahinter. Konsistenz wird dort erreicht, indem die Umgebung zum Generierungsziel gemacht wird statt zu einer kompositierten Platte.

Keiner der beiden Ansätze ist strikt besser, und sie scheitern auf unterschiedliche Weise. Referenzkonditionierte Generierung scheitert daran, dass sie über einen langen Clip hinweg vom vorgegebenen Subjekt abdriftet. Chunkweise Generierung mit einer autoregressiven Historie scheitert daran, dass sie über eine lange Sitzung hinweg wandert, wenn der Umgang mit Drift falsch ist – genau das Scheitern, das die dritte Destillationsstufe verhindern soll. Wan 2.7 ist die sicherere Wahl, wenn das zu liefernde Ergebnis eine bestimmte Person in einem bestimmten Look ist. Griffin konkurriert nicht um dieses Briefing.

Sicherheit, Provenienz und die Release-Haltung

Wan 2.7 verfügt über kein veröffentlichtes Provenienzsystem, das mit einem Wasserzeichen vergleichbar wäre, das Komprimierung übersteht – in der Ankündigung werden Audioqualität und Genauigkeit von Bildschirmtext als Bereiche genannt, die noch Arbeit erfordern, was ein Vorbehalt hinsichtlich der Wiedergabetreue und nicht hinsichtlich der Sicherheit ist.

Griffins Sicherheitsnarrativ ist umgekehrt: Der von Tavus angegebene Grund, es in der Vorschau zu belassen, ist, dass dieselben Eigenschaften, die es zu einer besseren Schnittstelle machen, es auch besser darin machen, jemanden davon zu überzeugen, dass er mit einem Menschen spricht, und die Zahlen stützen diese Sorge. In der unternehmenseigenen Live-Studie glaubten 26 von 54 Teilnehmenden, ihr Gegenüber sei eine echte Person, gegenüber 1 von 41 beim vorherigen Phoenix-4.5 / Raven-1 / Sparrow-2-Stack. Teilnehmende, die es doch vermuteten, vermuteten dies tendenziell innerhalb der ersten zwanzig Sekunden. Tavus sagt, vor der Veröffentlichung seien weitere Arbeiten an Alignment und Offenlegung erforderlich, das Unternehmen entwickle Offenlegungsfunktionen und arbeite mit Organisationen an Sicherheitsevaluierungen. Das ist das Substanzielste, was irgendjemand über dieses Modell veröffentlicht hat, und es ist auch der Grund dafür, dass es kein Produkt zu kaufen gibt.

Für alle, die die beiden als Werkzeuge vergleichen, ist die praktische Konsequenz einfach: Das eine lässt sich auf Anfrage generieren und ist heute auslieferbar, das andere ist ein Evaluierungsziel, dessen Veröffentlichung von einem Problem abhängt, das der Anbieter noch nicht gelöst hat.

Welches, wofür

• Wählen Sie Wan 2.7, wenn das zu liefernde Ergebnis Filmmaterial ist. Die anweisungsbasierte Bearbeitung von vorhandenem Material ist der Aufgabenbereich, in dem es ungewöhnlich stark und ungewöhnlich günstig ist, weil die Editing-Variante nur die Ausgabe in Rechnung stellt und das eingegebene Filmmaterial als kostenlos behandelt. Seine Reference-to-Video-Variante sollte man angesichts der Abschaltung am 10. Oktober prüfen, bevor man sich dafür entscheidet.

• Wählen Sie Griffin in diesem Quartal für nichts aus, denn Sie können es nicht. Fordern Sie Zugriff an, wenn Sie wissen müssen, ob eine Person es erkennen kann, oder wenn Ihre Roadmap von der Interaktionsschicht und nicht von der Footage-Schicht abhängt.

• Achte auf die Kluft, nicht auf eines der beiden Modelle. Griffins Ankunft macht den interessanteren Vergleich zu einem zukünftigen: ein System, das das gesamte Gespräch generiert, gegen eine Suite, die die gesamte Szene generiert. Das erste Produkt, das beides leistet, wird dasjenige sein, gegen das es sich lohnt, dies erneut zu lesen.

Wo ein Router passt – und wo nicht

Keines dieser Modelle ist im OrcaRouter-Katalog enthalten, und das sollte in diesem Abschnitt vor allem anderen erwähnt werden. Wan 2.7 ist über Alibabas eigene Plattformen erreichbar – Model Studio auf Alibaba Cloud und Qwen Cloud – sowie über kreative Tools von Drittanbietern, die es nach dem Launch integriert haben; Tavus Griffin ist nur über ein Anfrageformular erreichbar. Wenn eines von beiden routingfähig wird, erscheint es zum Listenpreis des Anbieters.

Der Teil einer Video-Pipeline, bei dem es sich um ein Routing-Problem handelt, ist der Text drumherum. Shot-Listen, Prompt-Erweiterung, Caption-Generierung, Zusammenfassungen der Qualitätsprüfung sowie die Transkript- oder Dialogarbeit, die einen Reference-to-Video-Durchlauf speist, sind allesamt Text-Calls, und diese laufen am selben OpenAI-kompatiblen Endpoint bei OrcaRouter wie 200+ andere Modelle zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preissenkung eines Anbieters noch am selben Tag wirksam wird statt erst nach einem Vertragszyklus. Ein günstiges Modell über einen Bulk-Durchlauf und ein Frontier-Modell über den finalen Durchlauf zu verteilen, ist dort eine Konfigurationsänderung statt eine zweite Anbieterbeziehung — dasselbe Argument gilt für die Generierungsebene, sobald die Generierungsebene etwas ist, das man aufrufen kann.

Worauf zu achten ist: ob die Referenz- und Bearbeitungsvarianten der Wan-2.7-Suite die Stilllegung von Model Studio am 10. Oktober unverändert überleben und ob Griffins Safety-Gate eine veröffentlichte Modellkarte mit einem darauf befindlichen Endpunkt hervorbringt. Diese beiden Ereignisse wären es, die diesen Vergleich von einem Design-Essay in eine Beschaffungsentscheidung verwandeln würden.

A two-column scoreboard titled "Tavus Griffin vs Alibaba Wan 2.7 — the scoreboard". Left column "Tavus Griffin": Makes: a live conversation; Price: none published; Output: 720p in 320 ms chunks; Input: a person on camera; Clip length: none - a session; Score: VideoFDB 3.83 of 5. Right column "Alibaba Wan 2.7": Makes: 2 to 15 second clips; Price: $9.00 per minute; Output: up to 1080p; Input: text, image, video; Clip length: 2 to 15 seconds; Score: arena Elo 1,032. Footer: "Wan rates per Alibaba Cloud; Elo per Artificial Analysis, 2 October 2026. Griffin figures Tavus-reported."