Hero-Titelkarte für „Tavus Griffin vs. Runway Gen-4.5“ mit dem Untertitel „Konversation und Rendering sind zwei verschiedene Rechnungen“, über vier Chips: Gen-4.5 0,12 $ pro Sekunde Filmmaterial; Gen-4.5 2–10-Sekunden-Clips, kein Audio; Griffin Vollduplex, unterbrechbar; Griffin kein veröffentlichter Preis.
Guides & Insights

Tavus Griffin vs. Runway Gen-4.5: Konversation und Rendering sind zwei verschiedene Rechnungen

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Stellt man Tavus Griffin und Runway Gen-4.5 nebeneinander, fällt einem als Erstes auf, dass sie keine gemeinsame Maßeinheit haben. Griffin, im Oktober 2026 von Tavus als Research Preview angekündigt, ist ein Human Interaction Model – ein Video-zu-Video-System, das ein Live-Gespräch von Angesicht zu Angesicht führt und Gesicht und Stimme des anderen Teilnehmers erzeugt, während der Anruf läuft. Runway Gen-4.5, am 1. Dezember 2025 angekündigt und ab dem 12. Dezember für zahlende Abonnenten ausgerollt, ist ein Text-zu-Video- und Bild-zu-Video-Generator, der Ihnen pro Sekunde des Materials, das er rendert, in Rechnung stellt. Einer von ihnen wird pro Runde verkauft, der andere pro Sekunde, und die einzige ehrliche Art, sie zu vergleichen, ist festzustellen, dass eine Minute Griffin und eine Minute Gen-4.5 nicht dieselbe Minute sind.

Zwei Uhren, die in entgegengesetzte Richtungen laufen

Gen-4.5 ist seit fast einem Jahr in den Händen zahlender Kunden. Es erzeugt Clips von zwei bis zehn Sekunden aus einer Texteingabe oder einem Standbild, bei 720p und 24 oder 25 Bildern pro Sekunde, in sechs Seitenverhältnissen. Es gibt keine Audiospur, kein Multi-Shot-Storyboarding und keinen Dialog — es ist eine Rendering-Engine, und eine disziplinierte. Seine API ist asynchron, was die richtige Form für eine Aufgabe ist, die länger dauert, als eine Anfrage sollte. Runways eigene API bedient auch Video-Modelle von Drittanbietern neben den eigenen, und das Unternehmen liefert ein Weltmodell aus, GWM-1, das verrät, wo Runway das interessante Problem sieht: nicht im Führen eines Gesprächs, sondern im Modellieren einer Szene.

Griffin weist in die entgegengesetzte Richtung. Jede Designentscheidung in der veröffentlichten Architektur von Tavus dreht sich um Latenz statt um Wiedergabetreue. Der Tavec-Codec läuft mit 48 kHz, mit 40 Werten pro Frame bei 100 Frames pro Sekunde, ohne Codebooks, mit einem vollständig kausalen Decoder und Paketen von nur 10 Millisekunden. Der Videopfad gibt 720p in 320-Millisekunden-Blöcken aus, wobei ein Latent acht Frames bei 25 fps abdeckt und jedes Latent drei Diffusionsschritte kostet. Die Audio-zu-Video-Latenz liegt auf H100s im Durchschnitt bei 0,43 Sekunden, was Tavus zufolge etwa die Hälfte der nächstschnellsten Methode ist, die es gemessen hat. Nichts in diesem Stack versucht, zehn wunderschöne Sekunden zu rendern. Alles darin versucht, die nächsten 320 Millisekunden rechtzeitig zu rendern.

Der Spezifikationsvergleich ist also real, aber er ist keine Anzeigetafel:

• Abrechnungseinheit — Runway Gen-4.5 wird in Sekunden der Ausgabe abgerechnet; Sie kennen Ihre Kosten, bevor Sie auf „Generieren" klicken. Griffin hat überhaupt keinen veröffentlichten Preis, denn es gibt kein öffentliches Produkt.

• Cliplänge — Gen-4.5 erzeugt zwei bis zehn Sekunden; Griffin läuft so lange, wie der Anruf dauert.

• Auflösung und Bildrate — Gen-4.5 rendert 720p mit 24 oder 25 fps; Griffin streamt 720p mit 25 fps in 320-Millisekunden-Chunks.

• Audio — Gen-4.5 erzeugt keine Audiospur; Griffin generiert Sprache und Video zusammen und klont eine Stimme aus einer etwa 10-sekündigen Probe.

• Interaktivität — Gen-4.5 ist eine unidirektionale asynchrone Anfrage; Griffin ist Vollduplex und kann mitten im Sprechen unterbrochen werden.

• Bewegungs- und Grading-Extras — Gen-4.5 bietet ProRes- und PNG-Export gegen einen Aufpreis von 5 Credits pro Sekunde sowie HDR mit 20 Credits pro Sekunde, steigend auf 40 ab etwa vier Megapixeln; bei Griffin gibt es kein Äquivalent, da es keine Dateien exportiert.

• Verfügbarkeit — Gen-4.5 ist seit dem 12. Dezember 2025 für zahlende Abonnenten verfügbar; Griffin befindet sich in einer Research-Preview für ausgewählte Tester, und Tavus gibt an, dass es nicht für die Nutzung durch Kunden verfügbar ist.

Board titled 'Two Clocks, Two Bills' with six labelled rows comparing Runway Gen-4.5 (left) against Tavus Griffin (right): billing unit 'Runway Gen-4.5 - 12 credits per second of video' versus 'Tavus Griffin - no price, no product'; clip length 2 to 10 seconds versus as long as the call runs; resolution 720p at 24 or 25 fps versus 720p at 25 fps in 320 ms chunks; audio no audio track versus speech and face generated together; interactivity one asynchronous request versus full duplex, interruptible; availability live for subscribers since 12 December 2025 versus research preview, not sellable.

Die Gen-4.5-Rechnung, in einfachen Zahlen

Runway berechnet Gen-4.5 mit 12 Credits pro Sekunde generierten Videos. Bei den üblichen einem Cent pro Credit ergibt das 0,12 $ pro Sekunde, oder rund 7,20 $ für eine volle Minute Filmmaterial, wenn man eine Minute durchgehend generieren könnte – was nicht möglich ist, denn das Modell ist auf zehn Sekunden begrenzt. Eine Minute bedeutet also sechs oder mehr separate Generierungen, die zusammengesetzt werden, mit all den Kontinuitätsfehlern, die das mit sich bringt. Die ProRes- und PNG-Ausgabe kostet zusätzlich 5 Credits pro Sekunde, und HDR kostet zusätzlich 20 Credits pro Sekunde, steigend auf 40 oberhalb von etwa vier Megapixeln. API-Credits werden getrennt von App-Abonnement-Credits abgerechnet – ein Detail, das Teams auf dem falschen Fuß erwischt, wenn sie in der Web-App einen Prototyp bauen und dann zur API wechseln.

Board titled 'What One Minute Costs'. Left card, a minute of Runway Gen-4.5: rate 12 credits per second, about $0.12; hard limit 10 seconds per generation; so a minute means six or more separate generations; list price if it could run straight through about $7.20; extras ProRes or PNG +5 credits per second; HDR +20 credits per second, up to +40 above 4 MP. Right card, a minute of Tavus Griffin: rate none published; product research preview for selected testers; so a minute means not obtainable at any price; published evidence 0.43 s average audio to video on H100s; vendor statement not available for customer use at this time; availability no API, no price, no date.

Wo Gen-4.5 erreichbar ist, spielt ebenfalls eine Rolle. Es ist über Runways eigene API und über mehrere Drittanbieter-Plattformen verfügbar. Es ist keine OrcaRouter-Route – wir hosten es nicht, und wir werden nicht suggerieren, dass Sie es hier bekommen können.

Was Griffin kostet – und warum das die falsche Frage ist

Für Tavus Griffin gibt es keinen Preis. Das Veröffentlichungsmaterial von Tavus besagt, dass Griffin-Lite, die Research Preview, heute einer ausgewählten Gruppe früher Tester zur Verfügung steht, dass eine breitere Veröffentlichung eines leistungsfähigeren Modells folgen wird, dass Griffin-Lite derzeit nicht für die Kundennutzung verfügbar sein wird und dass Griffin noch nicht auf der Tavus-Plattform ist – es wird kommen, sobald das Unternehmen geklärt hat, wie es sicher veröffentlicht werden kann.

Dieser Absatz hat es in sich. Er bedeutet, dass der Vergleich in diesem Artikel keine Beschaffungsentscheidung ist und auch keine werden kann, solange Tavus keinen Preis nennt. Er bedeutet außerdem, dass Tavus ungewöhnlich direkt über ein Ergebnis spricht, das die meisten Anbieter als Produktseite mit einem „Contact Sales“-Button veröffentlicht hätten.

Was Griffin tatsächlich veröffentlicht, sind Belege zum Verhalten. In einer gemeinsam mit der Queen Mary University of London durchgeführten Studie hielten 26 von 54 Teilnehmenden – 48 % – Griffin nach einem einminütigen Videoanruf für eine echte Person, gegenüber 1 von 41 (2,4 %) beim früheren Stack von Tavus aus Phoenix-4.5, Sparrow-2 und Raven-1. Im VideoFDB-Benchmark von NVIDIA, bewertet im September 2026, meldet Tavus den ersten Platz bei Face-to-Face-KI: Generierung 3,83 gegenüber 2,80 für die stärkste gemeldete Baseline und 3,92 für die menschliche Referenz, Wahrnehmung 3,73 gegenüber 3,44 für die beste gemeldete Baseline und 4,20 für einen Menschen, mit einer Aufgaben-Zielerreichungsrate von 73,8 % auf der Wahrnehmungsseite über fünfzehn evaluierte Modelle hinweg. Das sind vom Anbieter gemeldete Zahlen, die auf einem von NVIDIA entwickelten Benchmark beruhen, und sie betreffen Konversation, nicht Kinematografie.

Screenshot of the Tavus website's Griffin announcement, captured 2 October 2026: the headline 'The First Human Interaction Model' under 'Introducing Griffin', a paragraph describing a video-to-video system that listens while the other person talks, and three statistic tiles reading 48% of people believed Griffin was a real person after a one-minute video call, #1 on NVIDIA's independent test of face-to-face AI, and 37% ahead of the next best AI at reacting in the moment, dated October 1st, 2026.

Die verschiedenen Aufgaben, einfach ausgedrückt

Wenn Sie eine Aufnahme einer Stadt in der Dämmerung möchten, mit einer Kamerabewegung, die zu einem Referenzframe passt, ist Gen-4.5 ein Werkzeug, das existiert und das heute für etwa zwölf Cent pro Sekunde tun kann. Es gibt kein Szenario, in dem Griffin Ihnen hilft, denn Griffin akzeptiert keinen Prompt und gibt keine Datei zurück.

Wenn Sie ein Gesicht möchten, das zuhört, unterbrochen wird und ein Gespräch über mehrere Minuten hinweg kohärent hält, kann Gen-4.5 nicht helfen, denn es akzeptiert keine Eingaben, nachdem die Anfrage gesendet wurde. Ein zehnsekündiger Clip mit einem sprechenden Kopf darin ist kein Gespräch; es ist ein Video eines Gesprächs, und genau diesen Unterschied verkauft Tavus.

Die Überschneidung ist geringer, als das Label „AI video“ vermuten lässt: Beide geben Pixel einer Person aus, und beide laufen mit 720p und 25 fps. Alles darüber hinaus ist unterschiedlich, einschließlich der Einheit auf der Rechnung.

Warum ein Router genau an dieser Stelle nützlich ist

Teams, die am Ende beides brauchen, entdecken das meist auf die harte Tour – ein Produkt will einen generierten Establishing Shot und einen sprechenden Avatar, und die beiden kommen von verschiedenen Anbietern mit unterschiedlicher Authentifizierung, unterschiedlichen Guthabensystemen und unterschiedlichen Fehlerarten. Das ist der Fall, in dem ein einzelner Endpunkt seinen Wert beweist. OrcaRouter führt über zweihundert Modelle hinter einem Schlüssel, gibt die Listenpreise der Anbieter mit 0 % Aufschlag weiter, sodass eine Preisänderung eines Anbieters noch am selben Tag auf der Abrechnung wirksam wird, und wiederholt Anfragen bei einem gesunden Anbieter, wenn eine Route ausfällt, statt Ihnen einen Timeout zu liefern. Eine Routing-DSL lässt Sie unkritische Entwürfe dorthin schicken, wo die Kapazität am günstigsten ist, und alles Kundennahe an einen bestimmten Anbieter binden, und Modell-Fusion lässt Sie ein günstiges Textmodell vor einen teuren Generierungsaufruf setzen, um einen Prompt umzuschreiben, bevor Sie die Sekunden ausgeben.

Um genau zu sein, was das in dieser Gegenüberstellung abdeckt und was nicht: Gen-4.5 ist keine unserer Routen, und Griffin auch nicht. Die Videoseite des Katalogs umfasst minimax/minimax-h3, MiniMaxs omni-modalen Generator, mit 0,08 $ pro Sekunde Output bei 768P und 0,13 $ pro Sekunde bei 2K — ein Sekundenpreis auf derselben Achse wie bei Runway, von einem Modell, das wir Ihnen heute tatsächlich bereitstellen können. Das ist die ehrliche Empfehlung, wenn Sie generierte Sekunden benötigen und sie auf einer Rechnung mit allem anderen haben möchten.

Um welche herum sollte man planen?

Gen-4.5 ist mit großem Abstand die sicherere Abhängigkeit: Es ist seit Dezember 2025 bei zahlenden Kunden im Einsatz, seine API ist dokumentiert, seine Credits sind bepreist, und seine Limits – zehn Sekunden, kein Audio, kein Storyboarding – sind veröffentlicht und müssen nicht erst entdeckt werden. Ein Team, das generiertes Filmmaterial braucht, kann diese Woche starten.

Griffin ist die Wette mit der höheren Obergrenze und der niedrigeren Untergrenze. Seine 48 % und seine durchschnittliche Latenz von 0,43 Sekunden beschreiben etwas wirklich Neues, und die Tatsache, dass Tavus es noch nicht verkaufen will, ist eher ein Signal für die Reife dieses Etwas als eine Marketingentscheidung. Setzen Sie es nicht als Abhängigkeit in eine Roadmap; setzen Sie es auf eine Beobachtungsliste und schauen Sie wieder nach, wenn der Sicherheitshinweis verschwindet.