
Tavus Griffin vs. Google Veo 3.1: Das eine versieht jedes Einzelbild mit einem Wasserzeichen, das andere täuschte 48 % eines Raums.
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 223 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Stelle Tavus Griffin und Google Veo 3.1 nebeneinander, und der konventionelle Vergleich — Preis pro Sekunde, Elo, Clip-Länge — fällt sofort auseinander, weil nur einer von ihnen einen Preis hat und nur einer von ihnen in irgendetwas bewertet wird, das ein Käufer nachschlagen kann. Aber darunter liegt eine echte Achse, und sie ist nicht die Qualität. Googles Antwort auf synthetische Medien ist, sie erkennbar zu machen: Jede Veo 3.1-Ausgabe trägt SynthID, ein unsichtbares Wasserzeichen, das Bild für Bild in die Pixel und in das Audiospektrum geschrieben wird, plus C2PA Content Credentials, die die Dateiherkunft aufzeichnen, und Google hat einen Detektor in die Gemini-App integriert, sodass ein Nutzer fragen kann, ob Google AI einen Clip erstellt hat. Tavus Griffins angegebener Grund, in der Vorschau statt als Produkt zu existieren, ist das Spiegelbild: In Tavus' eigener Live-Studie beendeten 26 von 54 Teilnehmern einen einminütigen Videoanruf in der Annahme, ihr Gegenüber sei eine echte Person, gegenüber 1 von 41 beim vorherigen Stack des Unternehmens, und Tavus sagt, es halte das Modell zurück, bis es herausgefunden habe, wie es offenlegen könne, was es ist. Einer dieser Anbieter verkauft Detektion. Der andere ist derzeit der Grund, warum Detektion wichtig ist, und weiß es.
Zwei Produkte, gebaut auf gegensätzlichen Annahmen
Veo 3.1 ist ein Clip-Generator mit bewusst engem Rahmen. Über die Gemini-API von Google erzeugt er pro Durchlauf 4, 6 oder 8 Sekunden bei 24 fps, nativ in 720p, wobei 1080p und 4K über einen Upscaling-Durchlauf hinzukommen, der in einem Update vom Januar 2026 ergänzt wurde. Die Erweiterung fügt pro Durchlauf sieben Sekunden hinzu und lässt sich bis zu zwanzig Mal wiederholen, für eine theoretische Obergrenze von etwa 148 Sekunden, aber die Eingabe muss ein von Veo generierter Clip von höchstens 141 Sekunden in 720p in 16:9 oder 9:16 sein, und die Acht-Sekunden-Länge ist zwingend für die Erweiterung, für die Eingabe von Referenzbildern und für alles über 720p. Ein vier Sekunden langer 1080p-Clip lässt sich nicht erstellen. Die Ausgabe ist eine Datei, die Ihnen gehört, mit Wasserzeichen versehen und mit einem beigefügten signierten Provenienzdatensatz.
Griffin erzeugt keine Datei. Es führt ein Gespräch. Eine Engine zur kontinuierlichen Konversationsmodellierung nimmt Audio und Video auf und bewertet den Austausch in Subsekunden-Intervallen neu, wobei sie entscheidet, ob sie schweigen, ein Signal geben, Backchannel-Signale geben oder den Turn übernehmen soll, und gibt expressive Steuerungssignale aus, die einen Streaming-Sprachgenerator und einen Streaming-Videogenerator gemeinsam ansteuern. Der Videogenerator erzeugt 720p in 320-ms-Chunks, jeweils ein Latent nach dem anderen, mit 25 fps aus einem einzigen Referenzfoto, und spielt jeden Chunk ab, während er dekodiert. Es gibt keine Cliplänge, weil es keinen Clip gibt; es gibt eine Sitzung, die weiterläuft, bis jemand aufhört zu sprechen.
Diese Unterscheidung entscheidet über fast jede andere Zeile in diesem Vergleich. Der Rahmen von Veo 3.1 ist eine Reihe von Vorgaben, an denen eine Produktionspipeline ihre Planung ausrichten kann – Shotlists von acht Sekunden, eine Verlängerungsleiter für längere Takes, feste 24 fps, eine bekannte Auflösungsleiter. Griffins Ausgabe lässt sich im Voraus überhaupt nicht storyboarden, denn was Griffin rendert, hängt davon ab, was die Person als Nächstes tut.
Was Veo 3.1 in jeder Preisstufe kostet
Die von Google veröffentlichten Preise für die Gemini API enthalten Audio, gelten pro Sekunde Ausgabe, und es gibt auf keiner Veo-3.1-Stufe einen kostenlosen Tarif. Audio kann bei dieser API nicht deaktiviert werden – es wird bei jeder Anfrage generiert –, was insofern wichtig ist, als Drittquellen eine Vertex-AI-Preisliste beschreiben, bei der stummes Video ungefähr die Hälfte des audio-inklusiven Preises kostet. Googles eigene Dokumentation legt diesen Umschalter nicht offen. Wenn ein Preis für stummes Video für Ihre Abrechnung von Bedeutung ist, gleichen Sie ihn mit Ihrer eigenen Vertex-Abrechnung ab und nicht mit einer Vergleichsseite, einschließlich dieser hier.
• Veo 3.1 Standard — 0,40 $/s bei 720p und 1080p, 0,60 $/s bei 4K.
• Veo 3.1 Fast — 0,10 $/s bei 720p, 0,12 $/s bei 1080p, 0,30 $/s bei 4K.
• Veo 3.1 Lite — 0,05 $/s bei 720p, 0,08 $/s bei 1080p, ohne 4K-Stufe.
Wendet man die Acht-Sekunden-Regel auf diese Tarife an, sind die Kosten pro Versuch das, was ein Kreativteam tatsächlich veranschlagt: 32 Cent für eine achtsekündige 1080p-Aufnahme im Standard-Tarif, 80 Cent für eine vier Sekunden lange Aufnahme bei derselben Auflösung, weil die Acht-Sekunden-Untergrenze unterhalb von 720p nicht gilt, und 4,80 $ für eine einzelne achtsekündige 4K-Aufnahme. Bei dieser letzten Zahl sollte man kurz innehalten, denn eine Suche mit vier Versuchen nach einer brauchbaren 4K-Aufnahme kostet knapp unter zwanzig Dollar, und die Acht-Sekunden-Vorgabe bedeutet, dass man die Idee nicht bei halber Länge zum halben Preis testen kann.
Griffin hat keinen Preis, keine kostenlose Tarifstufe und keinerlei Preisliste. Griffin-Lite ist ausgewählten vertrauenswürdigen Testern als Research Preview über ein Anfrageformular verfügbar, nicht auf der Tavus-Plattform, und in der Ankündigung wird ausdrücklich klargestellt, dass es derzeit nicht für die Nutzung durch Kunden verfügbar sein wird. Tavus’ Schlusszeile auf der Seite lautet, dass Griffin kommen wird, sobald das Unternehmen herausgearbeitet hat, wie es sicher veröffentlicht werden kann. Jede Behauptung in diesem Artikel, die die beiden bei irgendetwas vergleicht, das einer Kaufentscheidung ähnelt, hat ein Loch in Griffins Hälfte davon, und keine noch so gründliche Recherche füllt es.
Was die beiden Anzeigetafeln tatsächlich messen
Die beiden Modelle wurden mit unterschiedlichen Instrumenten bewertet – aus demselben Grund, aus dem sie schwer gegeneinander zu bepreisen sind.
Veo 3.1 ist in der Video-Arena von Artificial Analysis zu finden, wo der Elo-Wert aus blinden paarweisen menschlichen Präferenzen bei kurzen Clips stammt. Nachzulesen am 2. Oktober 2026 im Text-to-Video-Board mit Audio:
• Veo 3.1 — 18.–21., Elo 968 (±11) bei 2.857 Stimmen, 24,00 $/min.
• Veo 3.1 Fast — 18.–21., Elo 961 (±10) bei 3.595 Stimmen, 7,20 $/Min.
• Veo 3.1 Lite — 21.–24., Elo 949 (±11) bei 2.762 Stimmen, 4,80 $/Min. • Veo 3.1 bei Bild-zu-Video (mit Audio) — 11. von 34, Elo 1.082 bei 7.049 Stimmen, 24,00 $/Min. Seine beste Platzierung auf irgendeiner Rangliste und die mit den meisten Stimmen dahinter.
Daraus ergeben sich zwei Dinge. Alle drei Stufen liegen nicht mehr als neunzehn Elo-Punkte auseinander, mit überlappenden Konfidenzintervallen, sodass der viermal höhere Preis pro Sekunde der Standard-Stufe keine messbare blinde Präferenz erkauft. Und Googles eigene neuere Gemini Omni Flash-Reihe übertrifft jede Veo 3.1-Stufe auf demselben Board — 7.–8. Platz mit Elo 1.117 nach 7.801 Stimmen und 9,12 $/Min., vor allen drei Stufen, während sie pro Minute zwischen einem Viertel und einem Fünftel davon kostet — eine Frage, die jeder Veo 3.1-Käufer stellen sollte, und eine, deren Beantwortung nicht in diesen Artikel gehört.
Griffins Zahlen stammen aus NVIDIAs VideoFDB, einem Benchmark für Vollduplex-Audio-Video-Konversation, den NVIDIA im September 2026 unabhängig erstellt und bewertet hat. Griffin-Lite erreichte 3,83 von 5 im Generation-Track gegenüber einer menschlichen Referenz von 3,92 und 2,80 für das nächstbeste veröffentlichte System sowie 3,73 im Perception-Track gegenüber einer menschlichen Referenz von 4,20. Tavus berichtet außerdem von 0,43 Sekunden echter Audio-zu-Video-Latenz für den Generator gegenüber vier veröffentlichten Streaming-Diffusions-Baselines auf H100s und beschreibt sie als halb so hoch wie die des nächstschnellsten.
Keines der beiden Sets überträgt sich. Ein Elo aus der Präferenzabstimmung über kurze Clips sagt nichts darüber aus, ob ein Modell unterbrochen werden kann; die Rubrikbewertung eines Judges zur Konversation sagt nichts darüber aus, ob ein Clip bei 4K richtig aussieht. Und die Vorbehalte gelten in beide Richtungen: Griffins Abstand von 0,09 Punkten zur menschlichen Referenz ist auf einer von einem Sprachmodell bewerteten Fünf-Punkte-Rubrik klein genug, dass „nahe am Menschen“ die ehrliche Lesart ist, und ein Teil seines Wahrnehmungsvorsprungs wird gegen Systeme gemessen, die ganz ohne Videoeingabe laufen.

Provenienz, die den eigentlichen Produktunterschied ausmacht
Für ein Unternehmen mit irgendeiner Offenlegungspflicht ist dies der einzige Abschnitt, der zählt – und das mit großem Abstand.
Veo 3.1-Ausgaben tragen SynthID Bild für Bild in den Pixeln und im Audiospektrum, darauf ausgelegt, Komprimierung, Größenänderung, Zuschneiden und Bildschirmaufzeichnung zu überstehen, und C2PA Content Credentials zeichnen die Dateiherkunft und Bearbeitungshistorie auf, interoperabel mit den Implementierungen von Adobe und Microsoft. Google hat die Erkennung in die Gemini-App integriert, sodass ein Nutzer ein Video hochladen und fragen kann, ob es von Google-KI erstellt wurde, wobei die Erkennung angibt, welcher Abschnitt der Audio- oder Videospur die Markierung trug. Die Einschränkung ist real und es lohnt sich, sie zu benennen: Dieser Detektor erkennt nur Googles Modelle. Nichts in den Büchern von Alibaba oder Kuaishou ist vergleichbar, und nichts von Tavus ebenso wenig.

Tavus hat für Griffin weder ein Wasserzeichen noch einen Detektor noch eine Content-Credentials-Pipeline veröffentlicht. Was es veröffentlicht hat, ist der Grund, warum es eines braucht. Die Face-to-Face-Studie äußert sich ungewöhnlich unverblümt über den Fehlermodus: über die Hälfte der Teilnehmer gab an, dass ihnen während des Anrufs nicht die Möglichkeit einer KI in den Sinn gekommen war, fast alle aus dieser Gruppe kamen zu dem Schluss, dass ihr Gegenüber real sei, und diejenigen, die doch Verdacht schöpften, kamen meist innerhalb der ersten zwanzig Sekunden dahinter. Die Überzeugten waren durchschnittlich zu 79 % sicher und die Zweifler zu 81 %. Das ist ein Modell, dessen Täuschungspotenzial kein Nebeneffekt der Generierungsqualität ist — es ist die Generierungsqualität.
Tavus’ Antwort steht in der Ankündigung und nicht in einer Fußnote: Dieselben Eigenschaften, die Human Interaction Models zu leistungsstarken Schnittstellen für natürliche Kommunikation machen, ermöglichen es ihnen, einen Menschen glauben zu lassen, es sei keine KI. Für eine sichere Veröffentlichung sind weitere Alignment- und Sicherheitsverfahren erforderlich, und das Unternehmen arbeitet an sicheren Offenlegungsfunktionen sowie mit Organisationen, die sich mit KI-Sicherheit befassen. Deshalb gibt es die Sperre. Griffin-Lite wird derzeit nicht für die Nutzung durch Kunden verfügbar sein.
Die Enterprise-Bedingungen, die Google mitbringt und Tavus nicht
Veo 3.1 wird über Vertex AI mit der regionalen Infrastruktur, IAM und der damit einhergehenden Enterprise-Vertragsfläche bereitgestellt, und Google schränkt ein, was das Modell je nach Rechtsraum tun darf: Über einen Parameter zur Personengenerierung erlauben die EU, das Vereinigte Königreich, die Schweiz und MENA nur erwachsene Personen, während andere Regionen alle zulassen können. Das ist eine dokumentierte, regionsbewusste Richtlinienoberfläche, und für einen regulierten Käufer kann sie schwerer wiegen als eine Leaderboard-Position.
Die Ausgestaltung hat ihren Preis. Die Modell-IDs von Veo 3.1 in der Gemini API sind weiterhin Preview-IDs — veo-3.1-generate-preview und ihre Geschwister —, während die Vertex-SKU eine Benennung für allgemeine Verfügbarkeit trägt und Berichte Dritter das Preview-Kontingent auf etwa ein Fünftel des Produktionskontingents schätzen. Google hat die älteren Veo 3.0-SKUs am 30. Juni 2026 eingestellt, was zeigt, wie mit Generationenwechseln umgegangen wird, und das sollte man in alles einpreisen, was auf einer Preview-ID aufbaut. Die Consumer-Oberfläche ist zudem wirklich eingeschränkt: Flow erfordert ein Google AI Pro- oder Ultra-Abonnement und ist in der EU, im Vereinigten Königreich, in Indien, Indonesien, Festlandchina und Russland blockiert, wobei kein VPN-Workaround angeboten wird.
Griffin hat keine Nutzungsbedingungen zum Lesen, denn es gibt keinen Dienst. Der Zugang ist ein Anfrageformular und eine Forschungsvorschau. Tavus hat erklärt, mit Sicherheitsorganisationen an Evaluierungen zu arbeiten und zu wollen, dass Menschen daran teilnehmen, was eher eine Forschungshaltung als eine kommerzielle ist.
Einen von beiden bekommen
Veo 3.1 ist über die Gemini API, Vertex AI, Google AI Studio und Flow erreichbar sowie über die Gemini-App, allerdings nur in 720p. Außerhalb Chinas ist es mit großem Abstand das der beiden, für das man leichter einen Schlüssel erhält, was gegen das obige Qualitätsargument spricht und der Hauptgrund dafür ist, dass dieser Vergleich trotz der Zahlen interessant bleibt.
Griffin erreicht man, indem man eine Zugriffsanfrage einreicht und als vertrauenswürdiger Tester ausgewählt wird. Das ist der gesamte Beschaffungsweg.
Wo ein Router in einer Veo-Pipeline wirklich hilft, ist neben dem Videomodell, nicht in ihm. Die Google-Textmodelle – Gemini 3.5 Flash, Gemini 3.1 Pro Preview, Gemini 3.6 Flash und der Rest der Reihe – sind im OrcaRouter-Katalog und über denselben OpenAI-kompatiblen Endpunkt aufrufbar wie 200+ andere Modelle zum Listenpreis des Anbieters mit 0 % Aufschlag. Shotlisten, Prompt-Erweiterung, Untertitelgenerierung, Kontinuitätsnotizen zwischen Acht-Sekunden-Segmenten und die Zusammenfassung von Reviews sind allesamt Textarbeit, und das ist die Ebene, auf der die Möglichkeit, ein günstiges Modell für einen Massendurchlauf und ein Frontier-Modell für den letzten Durchlauf einzusetzen, eine Konfigurationsänderung statt einer Migration kostet. Veo 3.1 selbst routen wir nicht, und Griffin ebenso wenig; es lohnt sich, das ausdrücklich zu sagen, statt einen Absatz wie diesen das Gegenteil implizieren zu lassen.
Welche, ehrlich gesagt?
• Wählen Sie Veo 3.1, wenn das Deliverable einen Herkunftsnachweis benötigt, wenn der Käufer reguliert ist, wenn die Bereitstellung als Datei mit angehängten Berechtigungsnachweisen erfolgen muss oder wenn 4K nicht verhandelbar ist. Planen Sie die Acht-Sekunden-Untergrenze in jedem Kostenmodell ein, und prüfen Sie den Lebenszyklus der Preview-ID, bevor Sie darauf einen kundenorientierten Pfad aufbauen.
• Wählen Sie nicht Griffin, denn Sie können es nicht. Beantragen Sie Zugriff, wenn Ihre Frage lautet, ob eine Person in einem einminütigen Anruf eine KI von einem Menschen unterscheiden kann, oder wenn Sie wissen müssen, wohin sich die Interaktionsschicht entwickelt, bevor Sie eine Roadmap auf die Clip-Schicht festlegen.
• Achten Sie auf den Detektor, nicht auf die Demo. Wenn Tavus einen Offenlegungsmechanismus veröffentlicht, der ein zwangloses Gespräch übersteht, verringert sich die Kluft zwischen diesen beiden Anbietern erheblich. Wenn nicht, ist Griffin ein Ergebnis, das es wert ist, zitiert zu werden, und Veo 3.1 bleibt der einzige der beiden, den Sie einem Compliance-Team vorlegen können.

