Eine Hero-Karte für „Tavus Griffin vs HeyGen Video 1“ mit drei Chips mit der Aufschrift „HeyGen Video — 0,01 $ pro Sekunde“, „Griffin — kein Preis, Zugang anfragen“ und „HeyGen Video — 5 bis 15 Sekunden bei 768p“, über sechs Zeilen: HeyGen gestartet: 30. September 2026; Griffin angekündigt: 1. Oktober 2026; HeyGen Preis: 0,01 $ pro Sekunde; Griffin Preis: keiner veröffentlicht; HeyGen-Ausgabe: 5- bis 15-sekündige Clips; Griffin-Ausgabe: eine Live-Session. Fußzeile: „HeyGen Video wurde am 30. September 2026 gestartet; Griffin wurde am 1. Oktober 2026 als Vorschau angekündigt.“
Guides & Insights

Tavus Griffin vs. HeyGen Video 1: Sechsunddreißig Stunden auseinander, und nur eines ist käuflich

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Markteinführungen landeten innerhalb von sechsunddreißig Stunden beieinander im selben Marktsegment, und der Kalender ist das Interessanteste an dieser Paarung. HeyGen Video ging am 30. September 2026 live, für 0,01 $ pro Sekunde bis Ende Oktober, auf Basis von MiniMax H3 abgestimmt und ausgeliefert unter der Kennung heygen-video-1. Tavus Griffin wurde am 1. Oktober 2026 mit einer Live-Face-to-Face-Studie angekündigt, in der 26 von 54 Teilnehmenden glaubten, ihr Gegenüber sei eine echte Person, und es ist nur für ausgewählte vertrauenswürdige Tester über ein Anfrageformular verfügbar, ohne Kennung, ohne Endpunkt und ohne Preis. Bei beiden geht es darum, einen überzeugenden Menschen zu erzeugen. Der ehrliche Grund, Tavus Griffin und HeyGen Video 1 zu vergleichen, ist nicht, dass ein Käufer zwischen ihnen wählen würde – heute kann nur eines von beiden gekauft werden –, sondern dass der Unterschied erklärt, wofür jedes gebaut wurde und was eine Sekunde eines generierten Menschen tatsächlich wert ist.

Der eine verkauft einen Clip, der andere verkauft ein Gespräch.

HeyGen Video ist ein Allzweck-Videomodell, das zufällig ungewöhnlich gut mit Menschen umgehen kann. Es nimmt einen Prompt entgegen, oder einen Prompt plus ein Bild, oder einen Prompt plus bis zu neun Referenzbilder, drei Referenzvideos und drei Referenz-Audioclips, und liefert einen 5 bis 15 Sekunden langen Clip in 480p oder 768p, 24 fps, mit AAC-Audio in 32 kHz Stereo, das generierten Dialog, Ambiente und Effekte überträgt. Drei Modi decken die Konditionierung ab — text_to_video, image_to_video und reference_to_video, der standardmäßig gilt — und die Reihenfolge in der Liste wird zur Bezeichnung, die man im Prompt anspricht, sodass der erste Eintrag von reference_imagesist<Picture 1>. Unbekannte Felder in der Anfrage werden abgelehnt statt ignoriert, und ein Seed ist eine vorzeichenlose 32-Bit-Ganzzahl, die eine Aufnahme wiederholbar macht, wenn man ihn festhält und jeweils eine Klausel ändert. Es ist ein Produktionswerkzeug mit einem deterministischen Rahmen.

Griffin kehrt nahezu jede einzelne dieser Eigenschaften um. Es generiert 720p in 320-ms-Chunks mit 25 fps aus einem einzigen Referenzfoto und spielt jeden Chunk beim Dekodieren ab, sodass weder eine Clip-Länge anzugeben noch eine Datei zurückzugeben ist. Eine Continuous-Conversational-Modeling-Engine nimmt Audio und Video entgegen und bewertet den Austausch in Abständen von weniger als einer Sekunde neu, wobei sie entscheidet, ob sie schweigt, ein Signal gibt, einen Backchannel sendet oder das Rederecht übernimmt; ihre Ausdruckssteuerungen treiben parallel einen Streaming-Sprachgenerator und einen Streaming-Videogenerator an. Eine mitten im Satz getroffene Entscheidung schlägt sich noch innerhalb desselben Mini-Turns in der Stimme und im Gesicht nieder. Man schreibt keinen Prompt; man spricht einfach damit, und es reagiert auf eine Pause, einen Blick zur Seite oder eine Unterbrechung.

Deshalb sind die beiden keine Substitute, obwohl beide einen Menschen erzeugen. HeyGen Video wird gefragt, wie ein beschriebener Moment aussieht. Griffin wird gefragt, was als Nächstes passieren soll.

Was jede Sekunde kostet, bei der, wo man Sekunden kaufen kann

Der Einführungspreis von HeyGen Video beträgt bis einschließlich Oktober 0,01 $ pro Sekunde, und der eigene Text von HeyGen beschreibt das als 50 % Rabatt auf einen Standardpreis von 0,02 $. Das Kostendiagramm auf derselben Seite, in der Fußnote als Listenpreis pro Sekunde bei 768p mit Audio vor Einführungsaktionen ausgewiesen, gibt ihn mit 0,03 $ an. Das ist eine Diskrepanz von 50 % zwischen dem Text und dem Diagramm im eigenen Einführungsmaterial eines Anbieters, und solange HeyGen keine API-Preisseite veröffentlicht, ist die sichere Lesart, dass 0,01 $ bestätigt ist, weil er live ist, und dass die Zahl nach Oktober irgendwo zwischen 0,02 $ und 0,03 $ liegt.

Rechnen Sie das für tausend Sekunden durch – hundert Zehn-Sekunden-Clips –, also die Einheit, in der ein Bulk-Team tatsächlich denkt:

• HeyGen Video im Oktober — 10 $ bei 0,01 $ pro Sekunde.

• HeyGen Video ab Oktober — 20 $ bei 0,02 $ oder 30 $ beim Diagrammpreis von 0,03 $.

• MiniMax H3, das Basismodell, von dem es feinabgestimmt wurde — 80 $ zum MiniMax-Listenpreis von 0,08 $ pro Sekunde.

• Kling 3.0 Pro — 168 $ zu 0,168 $ pro Sekunde.

• Veo 3.1 — $400 zu $0.40 pro Sekunde.

Der Grund, warum die Arithmetik im Mittelpunkt von HeyGens Markteinführung steht, ist die Verwerfungsrate. Teams, die Social-Cutdowns, Werbevarianten und Produkt-Loops erstellen, generieren weit mehr, als sie ausliefern, und bei zehn Cent pro Zehn-Sekunden-Versuch ändert sich die Wirtschaftlichkeit des Verwerfens von Kandidaten grundlegend. Der Haken ist die Obergrenze: 768p bei 24 fps ist kein 2K-Auslieferungsformat, und MiniMax H3 erreicht 2K über ein separates Regenerierungsmodul auf der eigenen gehosteten API von MiniMax für 0,13 $ pro Sekunde – auf HeyGen Video gibt es dafür keine Entsprechung. Wenn Ihr Auslieferungsziel über 768p liegt, ist die günstige Sekunde nicht die Sekunde, die Sie brauchen.

Griffins Spalte in dieser Liste ist leer, und nicht auf vielversprechende Weise. Tavus hat keinen Preis veröffentlicht, denn Griffin-Lite ist eine Forschungsvorschau, die laut ihrer eigenen Ankündigung zum jetzigen Zeitpunkt nicht für die Kundennutzung verfügbar sein wird und nicht auf der Tavus-Plattform ist. Bei einem Tausend-Sekunden-Modell gibt es nichts einzutragen. Wer eine Zahl für Griffin nennt, denkt sie sich aus.

Die Qualitätszahlen und wer bewertet

Keines dieser beiden Modelle hat eine unabhängige Bewertung, was man vorab erwähnen sollte, denn beide Anbieter haben Diagramme.

Bei HeyGen handelt es sich um eine Elo-Tabelle, in der HeyGen Video auf 1000 normalisiert ist, dann Dreamina Seedance 2.0 bei 955, die H3 Max-Familie erstreckt sich von 952 bis hinunter auf 860, Kling 3.0 Pro bei 857 und Veo 3.1 bei 744. Die Fußnote erledigt den Großteil der Arbeit: Die Werte stammen aus einem internen Evaluationsdatensatz von Abfragen der Artificial Analysis Arena mit 4.800 Stimmen, und HeyGens eigener Wert ist für einen einfacheren Vergleich auf 1000 normalisiert. Dass ein Anbieter sich selbst an die Spitze seiner eigenen Grafik normalisiert, ist eine Darstellungsentscheidung, kein Beweis dafür, dass er führt. Der informative Teil sind die relativen Abstände darunter.

Nützlicher ist der Direktvergleich, die einzige Stelle, an der HeyGen gegen etwas testet, das nicht von HeyGen selbst stammt. HeyGen zufolge bevorzugten Blindtester das eigene Modell gegenüber dem im Chart aufgeführten H3 Max post-train in 55,8 % der Vergleiche bei 650 Stimmen, mit einer Spanne von 49–62 %. Diese Spanne ist das ehrliche Detail: Am unteren Ende umfasst sie die 50-%-Marke, sodass die Präferenz gegenüber diesem Rivalen nach den eigenen Zahlen des Anbieters nicht klar vom Rauschen zu trennen ist. Die Aufschlüsselung nach Einzelachsen ist uneinheitlich, und zwar so, dass sie wie ein spezifisches Fehlerprofil wirkt – 65 % bei der Treue zum Quellbild und 66 % beim Timing, gegenüber 43 % bei der Konsistenz und 45 % bei der Musik.

Griffins Zahlen stammen von einem Instrument, das jemand anderes gebaut hat, und das ist der Unterschied, der zählt. NVIDIAs VideoFDB ist ein Benchmark für audiovisuelle Vollduplex-Konversation, der in zwei Kategorien bewertet wird, und NVIDIA hat ihn entwickelt und führt die Bewertung mit einem eigenen Bewerter nach einem veröffentlichten Bewertungsraster durch. Griffin-Lite erzielte 3,83 von 5 bei der Generierung gegenüber einer menschlichen Referenz von 3,92, während das nächstbeste veröffentlichte System 2,80 erreichte, und 3,73 bei der Wahrnehmung gegenüber einer menschlichen Referenz von 4,20. Tavus berichtet außerdem von 0,43 Sekunden echter Audio-zu-Video-Latenz für den Generator gegenüber vier veröffentlichten Streaming-Diffusions-Baselines auf H100s. Die Vorbehalte gelten weiterhin – ein Abstand von 0,09 Punkten zum Menschen in einem Fünf-Punkte-Bewertungsraster, das von einem Sprachmodell bewertet wird, ist „nah dran“, nicht „gleich“, und ein Teil des Wahrnehmungsvorsprungs wird gegenüber Systemen gemessen, die ohne Videoeingabe laufen –, aber der Bewerter ist nicht der Anbieter.

• Unabhängige Qualitätsbewertungen – keiner von beiden hat welche. HeyGen Video taucht mit Stand vom 2. Oktober 2026 in keiner der drei Video-Bestenlisten von Artificial Analysis auf, und Griffin ebenso wenig. Griffin vielleicht nie: Eine Präferenzabstimmung im Paarvergleich über kurze Clips kann kein Live-Gespräch bewerten.

Dieselben Leaderboards führen das Basismodell tatsächlich. MiniMax H3 liegt mit Elo 1.139 auf Platz 4 bei Text-zu-Video (mit Audio) und mit 1.181 auf Platz 2 bei Bild-zu-Video, beides zu 4,80 $/Min. – HeyGens Post-Training tritt also auf einem Substrat an, das eine unabhängige Arena bereits nahe der Spitze einstuft, was das stärkste Argument zu seinen Gunsten ist, das HeyGen nicht selbst veröffentlicht hat.

A screenshot of the top of Artificial Analysis's text-to-video-with-audio board, captured 2 October 2026: Wan 3.0 first at Elo 1,157 and $12.00/min, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at Elo 1,139 with 7,496 votes and $4.80/min, MiniMax H3 Max (based on MiniMax H3) fifth at 1,134 with 5,510 votes, and FLUX 3 sixth at 1,127, with release months and per-minute API pricing columns visible.

Beide sind aus demselben Grund billig oder unbezahlbar.

Die strukturelle Tatsache, die beiden Markteinführungen zugrunde liegt, ist, dass es billig geworden ist, einen überzeugenden Menschen herzustellen, und der Kostenvorteil keines der beiden Unternehmen stammt von dem, was es verkauft.

HeyGen Video ist ein Post-Training von MiniMax H3, das MiniMax mit Gewichten veröffentlicht hat, die unter seiner eigenen Community-Lizenz verfügbar sind. Dadurch wurde H3 zu einer Grundlage, die andere Unternehmen spezialisieren und weiterverkaufen können, und HeyGen ist das zweite Produkt, das dies in fünf Wochen für eine andere Branche tut – Unternehmensvideos, Produktdemos, Schulungen, Immobilienrundgänge. Dieses Muster ist der Grund, warum HeyGen unter dem Preis des Basismodells anbieten kann: Es trägt nicht die Kosten des Basismodells, und die Basis ist die Open-Weights-Veröffentlichung von jemand anderem.

Griffin ist die Gegenwette. Tavus baute das gesamte System – den Codec, den Streaming-Sprachgenerator, den Streaming-Videogenerator, das Konversationsmodell – rund um die Interaktion selbst und destillierte einen großen bidirektionalen Diffusions-Lehrer in drei Stufen in einen autoregressiven Few-Step-Generator, damit lange Rollouts nicht abdriften. Das ist teure Forschung ohne offene Basis, auf die man sich stützen kann, und es ist ein plausibler Teil des Grundes, warum die Veröffentlichung zugangsbeschränkt ist: Darunter gibt es kein günstiges Substrat, das man amortisieren könnte.

Beide Unternehmen gelangen zudem aus unterschiedlichen Richtungen an denselben unangenehmen Punkt. HeyGens eigene Dokumentation listet auf, worin das Modell am schlechtesten ist, was selten und lesenswert ist: langer Text auf dem Bildschirm, weiche organische Bewegungen wie Blütenblätter, Papier und Haare sowie Nahaufnahmen von Händen bei Arbeiten wie dem Zusammenbauen oder Bedienen von Geräten. Am besten geeignet ist es für kurze, überschaubare Aufnahmen – ein Motiv, ein Ort, eine Aktion, eine feste oder sich bewegende Kamera. Griffins Einschränkung ist keine Liste von Fehlerarten, sondern ein ungelöstes Sicherheitsproblem: Tavus erklärt, dass die Eigenschaften, die ein Modell für menschliche Interaktion zu einer besseren Schnittstelle machen, es auch besser darin machen, jemanden davon zu überzeugen, dass er mit einem Menschen spricht, und dass das Unternehmen die Vorschau zurückhält, während es Offenlegungsmechanismen entwickelt.

Was ein Käufer heute tatsächlich tun kann

HeyGen Video ist jetzt aufrufbar. Es läuft über POST /v3/models/videos mit einem x-api-key-Header, nur mit bezahlten API-Schlüsseln, mit Download-Links, die signiert sind und ablaufen – sodass Polling sie erneuert – und Callbacks, die einmal pro Job versucht werden, wobei HeyGen selbst Ihnen rät, sie als Latenzoptimierung und nicht als Garantie zu behandeln. Wenn Sie es diesen Monat testen, ist die $0.01-Aktionssekunde live, die Ausgabeobergrenze liegt bei 768p, und der Prompt-Enhancement-Modus ist ein echter Kostenhebel: standardmäßig turbo, quality für einen längeren Durchlauf, disabled, um Ihren Text unverändert weiterzureichen.

Griffin ist nicht aufrufbar. Der Zugang ist ein Anfrageformular und eine Forschungsvorschau. Es gibt keinen Schlüssel, keine Kennung, keinen Endpunkt und kein SLA, und die einzige veröffentlichte Aussage zur Verfügbarkeit ist, dass sie kommen wird, sobald Tavus herausgefunden hat, wie man sie sicher freigibt.

Eine Gemeinsamkeit ist, dass keines von beiden ein Modell ist, zu dem ein Router dir verhelfen kann, und im Fall von Griffin ist das ein Kategorieproblem und kein vorübergehendes – eine Echtzeit-Vollduplex-Session ist kein Request-Response-Aufruf. Womit ein Router in beiden Pipelines hilft, ist die Ebene rund um das Video. Prompt-Erweiterung, Referenzbild-Inventar, Shot-Beschreibungen, Caption-Generierung und Review-Zusammenfassung sind alles Textaufrufe, und die von OpenAI, Google und den anderen liegen im OrcaRouter-Katalog hinter einem OpenAI-kompatiblen Endpoint mit 200+ Modellen am selben Key, zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preisänderung eines Anbieters noch am selben Tag live ist. Was das Videomodell selbst betrifft, gibt es eine nützliche Tatsache: MiniMax H3 – die Basis, aus der HeyGen Video abgeleitet wurde, und das, dessen Sekundenpreis durch HeyGens 0,01 $ unterboten wird – wird hier geroutet als minimax/minimax-h3 für 0,08 $ pro Sekunde, 2K für 0,13 $. HeyGen Video selbst ist nicht in unserem Katalog, und Griffin ebenfalls nicht; beide werden über die APIs ihrer eigenen Anbieter und mehrere Drittanbieter-Plattformen bereitgestellt.

A screenshot of OrcaRouter's own model page for MiniMax-H3, captured 2 October 2026, showing the model id minimax/minimax-h3 labelled "text + image + video + audio", an Output type of video, a p50 time-to-first-token of 375 ms, and the OrcaRouter navigation and pricing panels alongside.

Welche, und für wen?

• Verwende HeyGen Video, wenn das Ergebnis kurzes, in sich geschlossenes, personenzentriertes Filmmaterial mit integriertem Ton ist und du mit 768p bei 24 fps leben kannst. Setze den Tarif nach Oktober mit etwa 0,02 bis 0,03 $ pro Sekunde an statt mit dem Aktionspreis von 0,10 $, und teste langen Text auf dem Bildschirm sowie Nahaufnahmen von Händen gründlich, bevor du dich mit einem Workflow darauf festlegst, denn HeyGen hat dir bereits gesagt, dass es genau dort aussetzt.

• Planen Sie nicht um Griffin herum. Beantragen Sie Zugang, wenn Ihre Frage lautet, ob ein Mensch bei einem einminütigen Anruf einen generierten Menschen von einem echten unterscheiden kann, oder wenn Sie sehen müssen, wohin eine Echtzeit-Interaktionsschicht führt, bevor Sie eine Roadmap auf gerenderte Clips festlegen.

• Behalten Sie die Offenlegungsfrage im Auge, denn sie ist das Einzige, was beide bewegen wird. Die Kunden von HeyGen Video haben eine einfache Antwort parat — das Modell ist ein Post-Train eines Open-Weights-Basismodells, und die Ausgabe ist eine Datei mit bekannter Provenienz — während Tavus ein Modell gezielt zurückhält, gerade weil es noch keine hat. Welches Unternehmen auch immer den besseren Offenlegungsmechanismus veröffentlicht, wird das wertvollere Problem gelöst haben.

A two-column scoreboard titled "Tavus Griffin vs HeyGen Video 1 — the scoreboard". Left column "Tavus Griffin": Status: research preview; Price: none published; Output: live session; Resolution: 720p at 25 fps; Clip length: none - a session; Independent score: none. Right column "HeyGen Video 1": Status: live 30 September 2026; Price: $0.01 per second; Output: video file; Resolution: 768p at 24 fps; Clip length: 5 to 15 seconds; Independent score: none yet. Footer: "HeyGen price per HeyGen's launch page, October 2026. Neither has an independent score."