
Tavus Griffin vs. MiniMax H3: Ein duplexes Konversationsmodell trifft auf einen ausgelieferten Videogenerator
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 223 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Tavus Griffin und MiniMax H3 bringen beide einen sich bewegenden, sprechenden Menschen auf den Bildschirm, und über diesen ersten Eindruck hinaus gehören sie kaum derselben Produktkategorie an. Griffin ist ein Human Interaction Model – ein Video-zu-Video-System, das dafür gebaut wurde, eine beidseitige Konversation in Echtzeit zu führen, angekündigt von Tavus im Oktober 2026 und derzeit auf eine ausgewählte Gruppe früher Tester beschränkt. MiniMax H3 ist ein omnimodaler Videogenerator: Sie übergeben ihm einen Prompt plus optionale Bild-, Video- und Audioreferenzen, und er liefert einen fertigen Clip zurück. Das eine wird hinter verschlossenen Türen evaluiert; das andere ist seit Monaten herunterladbar, lizenzierbar und abrechenbar. Dieser Unterschied – nicht die Auflösung oder die Bildrate – entscheidet darüber, welches von beiden in Ihren Stack gehört.
Was jedes einzelne tatsächlich ist
Griffin ist Tavus’ Versuch, ein Modell zu entwickeln, das sich wie ein Teilnehmer verhält und nicht wie ein Renderer. Das Unternehmen beschreibt es als das erste Human Interaction Model, und die von ihm veröffentlichte Architektur teilt die Aufgabe in zwei Teile: Continuous Conversational Modeling, das von Moment zu Moment entscheidet, was die Persona tun sollte, und Audio-Visual Generation, das die passende Sprache und das passende Gesicht streamt. Entscheidend ist, dass es Vollduplex ist – es beobachtet und hört zu, während es spricht, sodass es unterbrochen werden kann, mitten in einer Äußerung reagieren kann und nicht auf ein sauberes End-of-Turn-Signal wartet, bevor es antwortet. Tavus selbst formuliert es so: Frühere Systeme lernten, Gesichter zu erzeugen; Griffin wurde entwickelt, um Gesprächsverhalten von Menschen zu lernen.
MiniMax H3 ist die Generation Hailuo 3, veröffentlicht am 31. Juli 2026 und als Open Source am 3. August 2026 unter der MiniMax H3 Community License freigegeben, wobei die Varianten H3-Base-FL2VA und H3-Base-Ref2VA offen publiziert wurden. Er liest Text-, Bild-, Video- und Audio-Referenzen als einen einheitlichen Kontext und liefert einen 4 bis 15 Sekunden langen Clip in 768P oder 2K mit nativem Stereo-Audio, generiert über eine dreistufige Pipeline (zuerst H3-Context-IR, dann H3-Base in 768p, dann H3-Regenerate-2K). Er ist ein Generator mit einer ungewöhnlich breiten Eingabefläche und einer wirklich permissiven Lizenz – all das, was Griffin derzeit nicht ist.
Die Spezifikationen, Seite an Seite

Warum „duplex“ das interessante Wort ist
Jeder Videogenerator, H3 eingeschlossen, wird danach beurteilt, wie ein Clip aussieht, sobald er fertig ist. Griffin wird an etwas gemessen, das ein Clip nicht zeigen kann: was in den 200 Millisekunden passiert, nachdem man ihn unterbrochen hat. Das ist das Problem, auf das die Rahmung durch das Human Interaction Model abzielt, und deshalb sind die Zahlen, mit denen Tavus wirbt, verhaltensbezogen statt visuell.
Die am häufigsten zitierte Zahl ist, dass 48 % der Menschen nach einem einminütigen Videoanruf glaubten, Griffin sei eine echte Person – 26 von 54 Teilnehmenden –, gegenüber 2,4 % für Tavus' vorherigen Stack aus Phoenix-4.5, Sparrow-2 und Raven-1, der 1 von 41 schaffte. Tavus berichtet außerdem, dass Menschen, die nicht überzeugt waren, dies tendenziell innerhalb der ersten 20 Sekunden vermuteten, was ein nützlicheres Detail ist als die Schlagzeile: Es bedeutet, dass die Illusion entweder früh hält oder früh zusammenbricht.
Der zweite Satz von Zahlen stammt aus NVIDIAs VideoFDB-Benchmark, bewertet im September 2026, bei dem Tavus zufolge Griffin in einem unabhängigen Test für Face-to-Face-KI den ersten Platz belegte. Auf der Generierungsseite erzielte Griffin 3,83 gegenüber 2,80 für die stärkste gemeldete Baseline (eine Konfiguration aus Gemini 2.5 plus Anam) bei einer menschlichen Referenz von 3,92 und einer aufgabenobjektiven Rate von 62,8 %. Bei der Wahrnehmung erzielte er 3,73 gegenüber 3,44 für MiniCPM-o 4.5, 3,17 für Gemini 2.5 Flash Native und 2,97 für eine reine Audio-Konfiguration von OpenAI gpt-realtime, gegenüber einer menschlichen Referenz von 4,20 und einer aufgabenobjektiven Rate von 73,8 %, über fünfzehn evaluierte Modelle hinweg. Tavus behauptet außerdem, dass Griffin beim Reagieren im Moment um 37 % vor dem nächstbesten System liegt. Dies sind vom Anbieter gemeldete Zahlen, die auf einem von NVIDIA erstellten Benchmark basieren, und sie sollten auch so gelesen werden – doch die menschlichen Vergleichspunkte sind diejenigen, die es wert sind, festgehalten zu werden, denn eine 3,83 gegenüber einer menschlichen Punktzahl von 3,92 ist ein viel kleinerer Abstand, als die Videogenerierung historisch gezeigt hat.
Was Sie heute kaufen können
Hier sind die beiden Modelle überhaupt nicht mehr vergleichbar.
MiniMax H3 ist ein Produkt. Es wird gehostet, es wird pro Sekunde generierter Ausgabe abgerechnet, und seine offenen Varianten liegen auf einem Modell-Hub und warten darauf, heruntergeladen zu werden. Wenn du einen fünfzehnsekündigen 2K-Clip mit Stereo-Audio von etwas haben möchtest, das nicht existiert, kannst du ihn heute Nachmittag haben, und du kannst die Gewichte selbst ausführen, wenn du sie lieber nicht mieten möchtest.
Tavus Griffin ist kein Produkt. Tavus sagt in der Griffin-Beschreibung ausdrücklich, dass Griffin-Lite, die Research Preview, heute für eine ausgewählte Gruppe früher Tester verfügbar ist, dass eine breitere Veröffentlichung eines leistungsfähigeren Modells folgen wird und dass Griffin noch nicht auf der Tavus-Plattform ist und erst dann kommen wird, wenn das Unternehmen herausgearbeitet hat, wie es sicher veröffentlicht werden kann. Das ist ein ungewöhnliches Maß an Offenheit von einem Anbieter über sein eigenes schillerndstes Ergebnis, und es ist wichtig für die Planung: Man kann Griffin nicht als Abhängigkeit in eine Produkt-Roadmap aufnehmen, und man kann keinen Preis dafür ansetzen, weil es keinen gibt.
Die ehrliche Planungsfrage lautet also nicht „Welche ist besser?“, sondern „Welche existiert auf der Ebene, die ich brauche?“.

Wo OrcaRouter passt
MiniMax H3 ist in unserem Katalog. Die Modellseite befindet sich unter minimax/minimax-h3, und die Abrechnung erfolgt so, wie der Anbieter sie vornimmt: 0,08 $ pro Sekunde generierter Ausgabe bei 768P und 0,13 $ pro Sekunde bei 2K. OrcaRouter gibt die Listenpreise der Anbieter mit 0 % Aufschlag weiter, sodass eine Preisänderung von MiniMax am selben Tag, an dem sie angekündigt wird, auf unserer Karte erscheint und nicht erst zum nächsten Abrechnungszyklus. Griffin ist nicht im Katalog und wird es auch nicht sein, bis Tavus es an Kunden ausliefert — wir hosten kein Modell, das wir nicht bedienen können, und eine auf ausgewählte Tester beschränkte Forschungsvorschau ist nichts, wozu ein Router routen kann.
Die praktische Konsequenz daraus ist, dass eines dieser beiden Modelle nur eine Codezeile von Ihrer Anwendung entfernt ist und das andere ein Forschungsaufsatz mit einer Telefonnummer. Wenn Sie bereits mehrere Video- und Sprachmodelle routen, macht die sekundengenaue Abrechnung bei H3 sie zudem zu einer Route, die es wert ist, hinter automatisches Failover gestellt zu werden: Eine Anfrage, die auf einen ausgelasteten Anbieter trifft, wird gegen einen gesunden erneut versucht, statt einen Timeout anzuzeigen, und eine Routing-DSL lässt Sie 2K-Jobs an einen bestimmten Anbieter binden, während 768P-Entwürfe dorthin fallen, wo die Kapazität am günstigsten ist. Modell-Fusion ist der andere Hebel, der hier erwähnenswert ist – H3s Sekundenpreis ist niedrig genug, dass es oft günstiger ist, ein Textmodell dafür auszugeben, einen Prompt vor der Generierung umzuschreiben und neu zuzuschneiden, als die verschwendeten Sekunden durch einen schlechten ersten Versuch.

Wo der Vergleich kippen könnte
Drei Dinge würden diesen Vergleich ändern, und nur drei.
Erstens: Wenn Tavus Griffin über eine kommerzielle API mit veröffentlichtem Preis anbietet, wird die ganze „Konversation versus Clip“-Rahmung zu einer echten Kaufentscheidung statt einer Terminplanungsentscheidung, und die 48-%-Face-to-Face-Zahl beginnt, direkt mit der Qualität der generativen Ausgabe zu konkurrieren. Zweitens: Wenn sich die Echtzeit-Story von H3 verbessert – und MiniMax hat aggressiv ausgeliefert –, würde ein Sekundengenerator, der streamen kann, Griffins Kernvorteil abstumpfen. Drittens: Wenn NVIDIA oder eine andere neutrale Partei VideoFDB erneut durchführt und H3 oder dessen Nachfolger einbezieht, ist die Behauptung, Griffin sei der Erste bei Face-to-Face-KI, nicht länger unfalsifizierbar. Tavus sagt, man gehe davon aus, Griffin sehr bald nach Behebung der Sicherheitsbedenken zu veröffentlichen; dieser Satz ist der ganze Zeitplan.
Fazit
MiniMax H3 und Tavus Griffin sind derzeit keine Rivalen, denn nur eines von beiden ist kaufbar. H3 ist ein ausgelieferter, offengewichteter, sekundenbasierter omnimodaler Generator mit veröffentlichtem Preis und einem Ausgabefenster von 4 bis 15 Sekunden; Griffin ist ein duplexfähiges Konversationsmodell mit den besten Face-to-Face-Werten, die je veröffentlicht wurden, ohne API, ohne Preis und mit einer ausdrücklichen Aussage seines eigenen Anbieters, dass Kunden es noch nicht nutzen können. Wenn Sie heute Videogenerierung brauchen, ist H3 die Antwort, und sie ist in Cent pro Sekunde messbar. Wenn Sie ein Echtzeit-Gesicht brauchen, das unterbrochen werden kann, behalten Sie Tavus im Auge – aber bauen Sie zuerst den Rest des Produkts, denn das Veröffentlichungsdatum ist ein Satz, kein Datum.
