
Tavus Griffin: Das erste Human-Interaction-Modell und die 48 %, die den Video-Turing-Test bestanden haben
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 223 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Sechsundzwanzig von vierundfünfzig Personen beendeten einen einminütigen Videoanruf und sagten, ihr Gegenüber sei eine echte Person gewesen. Das ist die Zahl, mit der Tavus für Tavus Griffin, das am 1. Oktober 2026 angekündigt wurde, wirbt, und es ist ein wirklich verblüffendes Ergebnis: unter demselben Protokoll brachte der vorherige Stack des Unternehmens — Phoenix-4.5, das das Gesicht renderte, Raven-1, das die Wahrnehmung übernahm, Sparrow-2, das die Gesprächsdynamik steuerte — eine von einundvierzig Personen dazu, es zu glauben, also 2,4 %. Die zwei offensichtlichen Lesarten dieses Sprungs sind beide falsch, und sie zu trennen, macht den größten Teil des Folgenden aus. Griffin ist keine bessere Avatar-Engine und kein Produkt, das man kaufen kann. Es ist eine Forschungsvorschau namens Griffin-Lx, die ausgewählten vertrauenswürdigen Testern offensteht, ohne Preisangaben, ohne öffentliche API und ohne Eintrag in irgendeiner unabhängigen Video-Rangliste. Dass beides gleichzeitig zutrifft, ist die eigentliche Geschichte.
Was die 48 % messen – und was nicht
Die Studie ist ein Face-to-Face-Turing-Test und keine Präferenzumfrage, und es lohnt sich, das Protokoll präzise darzulegen, gerade weil es die tragende Behauptung ist. Vierundfünfzig Teilnehmende wurden über eine unabhängige Forschungsplattform rekrutiert und ihnen wurde gesagt, dass sie für einen einminütigen Videoanruf mit einer anderen teilnehmenden Person zusammengebracht würden, in dem es darum gehen sollte, worauf sie sich in diesem Jahr freuten. Ihr Partner war ein PAL, auf dem Griffin-Lite lief und der Gesicht, Stimme und Antworten in Echtzeit erzeugte. Erst am Ende der Umfrage wurden sie gefragt, ob es ihnen in den Sinn gekommen war, dass der Partner möglicherweise keine echte Person sei, und allen Teilnehmenden wurde dann gesagt, dass es eine KI sei. Der Vergleichslauf verwendete dasselbe Protokoll auf dem älteren Stack, mit einundvierzig Teilnehmenden.
Die unterstützenden Zahlen sind genauso wichtig wie die Schlagzeile. Die Überzeugten waren zuversichtlich – im Durchschnitt 79 % –, und die Zweifler ebenso, mit 81 %, genau das, was eine Studie will: Niemand riet. Über die Hälfte der Teilnehmer gab an, die Möglichkeit sei ihnen während des Gesprächs überhaupt nicht in den Sinn gekommen, und fast alle aus dieser Gruppe sagten anschließend, der Gesprächspartner sei real gewesen. Die Teilnehmer, die tatsächlich Verdacht schöpften, neigten dazu, ihn innerhalb der ersten zwanzig Sekunden zu schöpfen. Das ist die unbequemste Zeile im Bericht und diejenige, die prägen sollte, wie Sie den späteren Abschnitt zur Sicherheit lesen.
Auf einer Sieben-Punkte-Skala erreichte das Modell durchschnittlich 5,4 für Natürlichkeit, 5,6 für Vertrauenswürdigkeit, 5,8 dafür, ob die Teilnehmer gerne wieder mit ihm sprechen würden – eine Bewertung, die auch bei Teilnehmern, die es korrekt als KI identifizierten, bei 5,4 blieb – und 5,5 dafür, ob sie das Gefühl hatten, dass ihr Gegenüber wirklich zuhörte. Die niedrigste Bewertung war 4,9 dafür, ob das Gespräch natürlich verlief. Als Ganzes betrachtet ergibt das ein spezifisches Profil: Griffin-Lite ist von Moment zu Moment überzeugend und als Gesamtbogen etwas weniger überzeugend.
Der unabhängige Benchmark und wie man seine zwei Tracks liest
Die Qualitätszahlen stammen aus NVIDIAs VideoFDB, einem Benchmark für vollduplexe audiovisuelle Konversation, der ein Modell in zwei getrennten Kategorien bewertet – Generation, also ob das Modell das richtige Verhalten erzeugt, und Wahrnehmung, also ob es den Moment versteht –, jeweils mit eigenem Bewertungsraster und eigener Bestenliste. NVIDIA hat den Benchmark entwickelt, führt die Bewertung mit einem eigenen Beurteiler anhand der veröffentlichten Metriken durch und bewertet die Antwort auf einer Skala von null bis fünf. Tavus hat ihn nicht durchgeführt, was der Grund dafür ist, ihn zu zitieren.
• Generation — Griffin-Lite erreichte 3,83, das nächstbeste veröffentlichte System erreichte 2,80 (Gemini 2.5 mit Anam), und die menschliche Ground-Truth-Referenz liegt bei 3,92. Das sind 1,03 Punkte mehr als beim besten vergleichbaren System und 0,09 Punkte weniger als beim menschlichen Referenzwert.
• Wahrnehmung — 3,73 gegenüber einem menschlichen Referenzwert von 4,20, mit 3,44 für die stärkste gemeldete Baseline, MiniCPM-o 4.5 in der Audio-Only-Konfiguration. Gemini 2.5 Flash Native erzielte 3,17 und gpt-realtime von OpenAI erzielte 2,97.
• Ausrichtung der Übernahmequote — 62,8 % bei der Generierung und 73,8 % bei der Wahrnehmung. Dies misst, wie genau die Entscheidungen des Modells darüber, wann es sprechen soll, mit dem Timing in den Referenzgesprächen übereinstimmen, und Tavus bezeichnet beide als die höchsten aller Systeme auf dem Board.
Zu diesen Zahlen gehören zwei Vorbehalte, bevor sie jemand wiederholt. Der Generationsabstand zum Menschen beträgt 0,09 auf einer Fünf-Punkte-Skala, die von einem Sprachmodell bewertet wurde, was man besser als „nahe am Menschen auf dieser Rubrik“ denn als „auf menschlichem Niveau“ lesen sollte. Und der Wahrnehmungsvergleich ist kein Äpfel-mit-Äpfel-Vergleich: MiniCPM-o 4.5 und gpt-realtime werden in reinen Audio-Konfigurationen bewertet, während Griffin auch Video verarbeitet. Der Vorsprung von 0,29 Punkten gegenüber einer reinen Audio-Baseline ist real, aber ein Teil dessen, was er misst, ist der Wert davon, Augen zu haben.
Die eigene Zusammenfassungszeile des Anbieters – Erster bei NVIDIAs unabhängigem Test für Face-to-Face-KI, 37 % vor der nächstbesten KI beim Reagieren im Moment – ist eine Charakterisierung derselben Daten und kein separater Befund. Behalte die zugrunde liegenden Track-Scores bei, nicht die Rahmung.

Zwei Motoren, die gleichzeitig laufen
Die architektonische Behauptung ist leichter zu bewerten als das Marketing darum herum, weil sie eine Aussage darüber ist, was gleichzeitig läuft. Griffin wird als zwei Systeme beschrieben, die parallel arbeiten, statt als eine Pipeline, die zwischen den Stufen übergibt.
Das erste ist eine Engine für kontinuierliche Konversationsmodellierung. Sie nimmt die Audio- und Videodaten der Person auf und bewertet den Austausch in regelmäßigen Abständen von weniger als einer Sekunde neu – Tavus nennt diese Mini-Turns –, wobei sie bei jedem einzelnen entscheidet, ob sie schweigen, ein Signal geben, ein Backchannel-Signal senden oder den Turn übernehmen soll. Die Ausgabe sind nicht nur die Worte, sondern eine Reihe expressiver Steuergrößen, die Timing, Haltung, Gesichtsausdruck und Gestik transportieren. Der Kern des Designs ist, dass eine mitten im Satz getroffene Entscheidung noch innerhalb desselben Mini-Turns in Stimme und Gesicht sichtbar wird und nicht erst nach einer Übergabe – dadurch kann das Modell stoppen, wenn es unterbrochen wird, nicken, während es zuhört, und eine Denkpause als etwas anderes als das Ende eines Turns behandeln.
Beim zweiten handelt es sich um eine Engine zur audiovisuellen Generierung, die diese Steuersignale gemeinsam in Klang und Pixel verwandelt: einen Streaming-Sprachgenerator und einen Streaming-Videogenerator, die von denselben Signalen angetrieben werden, sodass ein Tonwechsel und ein Ausdruckswechsel auf denselben Schlag fallen.
Eine ehrliche Anmerkung zum Material, das Tavus damit veröffentlicht hat, denn es könnte leicht für eine Messung gehalten werden. Das interaktive Diagramm eines neunsekündigen Austauschs ist im Text der Seite selbst als illustrativ gekennzeichnet und ausdrücklich nicht aus einer realen Sitzung gemessen. Derselbe Vorbehalt gilt für die Zeitangabe zum turnbasierten versus Vollduplex-Verfahren. Was gemessen wird, ist die Latenzzahl weiter unten.
Im Streaming-Stack
Die Audioseite basiert auf einem Codec namens Tavec, einem faltungsbasierten Autoencoder, der 48-kHz-Audio in ein kontinuierliches Latent mit 40 Werten pro Frame bei 100 Frames pro Sekunde abbildet, ohne Codebooks. Sein Decoder ist vollständig kausal, sodass er Zustand über Chunks hinweg beibehält und Audiopakete von nur 10 ms ohne Lookahead ausgibt. Eine Minute Sprache besteht aus 6.000 Latent-Frames statt aus 2,88 Millionen Rohsamples, was die Sequenz günstig genug macht, damit der Sprach-Transformer sie schneller als in Echtzeit vorhersagen kann. Der Sprachgenerator selbst ist ein autoregressiver Diffusion-Transformer, der auf ein kodiertes Sprecherpräfix konditioniert — eine Stimme kann aus etwa zehn Sekunden Audio geklont werden — und jeweils einen latenten Chunk erzeugt, sobald Steuersignale eintreffen, sodass die Wiedergabe beginnt, bevor die Äußerung beendet ist.
Die Videoseite geht von derselben Prämisse aus: Starke zeitliche Kompression ist das, was ein Diffusionsmodell schnell genug macht, um eine Konversation zu führen. Ein autoregressiver Generator mit wenigen Schritten nimmt ein Referenzfoto, das Streaming-Audio und die Streaming-Steuerungen und erzeugt pro Schritt ein Latent bei drei Diffusionsschritten pro Latent. Ein VAE komprimiert die Zeit um den Faktor acht, sodass bei 25 fps ein Latent acht Frames oder 320 ms 720p-Video entspricht. Ältere Latents werden mit zunehmend niedrigerer Auflösung beibehalten, damit lange Rollouts bezahlbar bleiben. Das Ergebnis ist ein Generator, der 720p in 320-ms-Chunks in Echtzeit ausgibt.
Der Weg dorthin erforderte eine dreistufige Destillation von einem großen bidirektionalen Mehrschritt-Diffusions-Teacher: Distribution Matching Distillation in einen Few-Step-Studenten, Teacher Forcing, um diesen Studenten in ein autoregressives Modell umzuwandeln, das jeweils ein Latent nach dem anderen erzeugt, und schließlich Training mit Self-Forcing auf der vom Modell selbst erzeugten Historie plus einem zusätzlichen Mechanismus, der auf die Historien-Frames wirkt, damit lange Rollouts nicht abdriften. Diese dritte Stufe ist diejenige, die den Fehlermodus adressiert, den diese Modellklasse üblicherweise hat – ein Gesicht, das an Qualität verliert, oder ein Hintergrund, der langsam wandert, über ein minutenlanges Gespräch hinweg.
Die Latenzzahl, die das eigentliche Produktversprechen ist
Im Vergleich zu vier veröffentlichten Streaming-Diffusionsmodellen in einem Audio-zu-Video-Setting, bei dem jedes Modell Sprache und ein Referenzbild erhält und das sprechende Gesicht erzeugen muss, erzielte der Generator von Griffin-Lite auf H100s eine durchschnittliche echte Audio-zu-Video-Latenz von 0,43 Sekunden – die Zeit vom Eintreffen eines Audiostücks bis zur Anzeige seiner Auswirkung im Video. Tavus bezeichnet das als die Hälfte der nächstschnellsten Methode. Außerdem meldet es den ersten Platz bei der Wahrnehmungsqualität von DOVER und FID sowie bei THEval, einem Evaluierungsframework für sprechende Köpfe, und den zweiten Platz bei der LSE-C-Lippensynchronisationskonfidenz mit 7,27, hinter einer Baseline – wobei der Anbieter anmerkt, dass LSE-C ausgeprägte Mundbewegungen belohnt, einschließlich Bewegungen über den Punkt hinaus, an dem es natürlich aussieht.
All das sind Tavus’ eigene Messungen gegenüber Baselines, die es selbst ausgewählt hat. Sie sind nützlich, weil sie spezifisch sind und weil der Wert von 0,43 Sekunden die Art von Zahl ist, die in einem Live-Test entweder standhält oder nicht. Sie sind nicht unabhängig, und die einzigen unabhängigen Werte in diesem Artikel sind die beiden oben genannten VideoFDB-Tracks.

Warum gibt es keinen Preis zum Vergleichen
Griffin-Lite ist ab heute für eine ausgewählte Gruppe früher Tester als Research Preview verfügbar; eine breitere Veröffentlichung eines leistungsfähigeren Modells soll folgen. Für die Nutzung durch Kundinnen und Kunden steht es derzeit nicht zur Verfügung. Der Zugang erfolgt über ein Anfrageformular. Es befindet sich nicht auf der Tavus-Plattform, und der Schlusssatz der Ankündigung des Unternehmens sagt es unmissverständlich: Griffin ist noch nicht auf der Tavus-Plattform und wird kommen, sobald Tavus herausgefunden hat, wie es sicher veröffentlicht werden kann. Alles, was ein Käufer normalerweise vergleichen würde – Preis pro Sekunde oder pro Anfrage, eine Modellkennung, Rate Limits, ein SLA, eine Regionsliste –, gibt es noch nicht. Tavus verweist alle, die heute bauen möchten, auf die Modelle, die 150.000 Entwickler und Unternehmen bereits nutzen – die drei Vorgängermodelle, nicht Griffin.
Das ist keine technische Spitzfindigkeit, die man in einer Fußnote abtun kann. Es verändert, wofür dieses Modell gerade jetzt gedacht ist. Es ist ein Evaluierungsziel für Teams, deren Produkt davon abhängt, ob eine Person es erkennen kann, und ein Signal dafür, wohin die Roadmap des Anbieters geht. Es ist nichts, worauf man in diesem Quartal einen kundenorientierten Pfad aufbauen sollte.
Das Sicherheits-Gate ist der Release-Plan
Das Interessanteste, was Tavus über Griffin geschrieben hat, betrifft nicht das Modell. Es ist das Eingeständnis, dass dieselben Eigenschaften, die ein Modell für menschliche Interaktion zu einer besseren Schnittstelle machen, es auch besser darin machen, jemanden glauben zu lassen, es sei keine KI, dass weitere Arbeit an Alignment und Sicherheit erforderlich ist, bevor eine sichere Veröffentlichung möglich ist, und dass das Unternehmen an Funktionen zur Offenlegung arbeitet und mit Organisationen an KI-Sicherheitsbewertungen zusammenarbeitet. Angesichts der Tatsache, dass fast die Hälfte einer Live-Stichprobe es nicht konnte und diejenigen, die es konnten, es meist innerhalb von zwanzig Sekunden herausfanden, ist ein Offenlegungsmechanismus, der ein beiläufiges Gespräch übersteht, kein Nice-to-have.
Zwei Dinge würden diesen Artikel wesentlich verändern. Eine veröffentlichte Modellkarte mit einem Endpunkt und einem Preis würde Griffin von einem Forschungsergebnis zu einer Beschaffungsfrage machen. Und ein Eintrag auf einem unabhängigen Video-Board – mit dem Vorbehalt, dass diese Boards kurze Clips nach paarweiser Präferenz bewerten und nicht dafür ausgelegt sind, ein Live-Gespräch zu bewerten, sodass die Diskrepanz dauerhaft statt vorübergehend sein kann – würde den Latenz- und Qualitätsaussagen eine externe Überprüfung geben. Bis eines davon vorliegt, sind die VideoFDB-Tracks die stärksten verfügbaren Belege, und sie gehen mit einer menschlichen Lücke von 0,09 bzw. 0,47 Punkten einher.
Das bedenkenswerte Gegenargument ist, dass ein Benchmark-Lauf kein Deployment ist. NVIDIAs Protokoll gibt jedem System dieselbe Turn-Taking-Aufgabe und denselben Judge; es sagt nichts darüber aus, wie sich die erste Stunde eines Anrufs verhält, was passiert, wenn zwei Personen eine volle Minute lang gleichzeitig sprechen, oder ob die Ausdruckskontrollen bei einem Gesicht schlechter werden, das das Referenzmodell schlecht gerendert hat. Tavus nennt das drift-spezifische Training – die Self-Forcing-Phase und den History-Mechanismus – als die Lösung für genau das, und Berichte sind alles, was ein Leser hat, bis jemand außerhalb von Tavus eine lange Sitzung durchführt und veröffentlicht. Betrachten Sie den Benchmark als die beste verfügbare Evidenz und nicht als ein Deployment.
Was man in der Zwischenzeit darum herum bauen kann
Die praktische Frage für ein Team, das heute so etwas haben möchte, ist, welche Teile des Stacks bereits kaufbar sind. Eine konversationelle Videoschnittstelle ist eine Kette — Spracherkennung, ein Sprachmodell, Sprachsynthese und im Fall von Tavus ein Rendering-Modell — und die ersten drei sind Massenware. Diese liegen hinter einem einzigen OpenAI-kompatiblen Endpunkt bei OrcaRouter mit über 200 Modellen unter demselben Schlüssel und Anbieterlistenpreis mit 0 % Aufschlag durchgereicht, sodass eine Preissenkung eines Anbieters hier noch am selben Tag wirksam wird statt erst nach einem Vertragszyklus. Wenn Sie eine Interaktionspipeline zusammenbauen und die Generierungsebene offenhalten möchten, bis Griffin oder etwas Ähnliches ein tatsächliches Produkt wird, dann kostet der Wechsel dort eine Konfigurationsänderung statt einer Migration. Tavus Griffin selbst ist hier kein geroutetes Modell, und das wird es auch nicht sein, solange es eine Vorschau hinter einem Anfrageformular ist.
Was es zu beobachten lohnt, ist nicht ein weiteres Demo-Reel. Es ist die Frage, ob das Offenlegungs-Tooling, das Tavus entwickelt, veröffentlicht wird, und ob eine zweite Forschungsgruppe das Face-to-Face-Protokoll reproduziert. Ein bestandener Turing-Test in dieser Größenordnung ist genau die Art von Ergebnis, für die ein zweites Labor nötig ist, das ihn durchführt.

